Problem

隨著大型語言模型(LLM)廣泛應用於軟體工程,AI 助理常產生跨越數百行的複雜程式異動。開發者因手動審查極其耗時,日益依賴 AI 提供的文字說明來理解異動內容,但目前缺乏衡量這些說明是否準確、可信的標準化基準測試。

Method

研究團隊開發了「ExplainBench」自動化評估框架,其核心理念在於:高品質的說明應能協助另一個 LLM 準確回答程式相關問題。該框架設計了一系列問題集,用以檢測 AI 說明是否能正確描述程式錯誤的預期行為,以及補丁(patch)套用後對系統產生的實際影響。

Results

實驗顯示說明品質是一個獨立的評估維度,其排名與廣泛使用的 SWE-bench 截然不同。研究揭露 AI 助理常出現「誤報」問題,即在說明中宣稱錯誤的補丁是正確的。為解決此問題,研究提出的「說明稽核助理」能透過執行額外測試來驗證並修正說明,顯著提升了所有受測模型的可信度。

Significance

此研究填補了 AI 助理可信度評估的空白,證實了程式撰寫能力強並不代表其解釋值得信賴。透過 ExplainBench 與自動化稽核機制,開發者能更有效地量化 AI 工具的品質,進而降低在軟體開發流程中因盲目信任 AI 說明而產生的風險。