Problem

現有的程式碼檢索基準測試缺乏經過執行驗證的「反事實」對照組。這導致研究者無法確認嵌入模型是否具備區分功能正確程式碼的能力,還是僅僅依賴語意或字面上相似、實則包含錯誤的程式碼變體。

Method

研究團隊開發了 ExecRetrieval 測試集,包含 939 個 Python 任務。每個任務皆配對一個正確的標準實作,以及最多四個僅經過微小修改(單一編輯)但功能錯誤的「干擾項」。評測對象涵蓋 23 種密集嵌入配置以及 BM25 演算法。

Results

實驗顯示領先系統在 exec@10 雖達 1.00,但 exec@1 僅有 0.331。在排名第一的錯誤結果中,高達 91.5% 至 99.4% 是外觀極其相似的錯誤變體。在 67% 到 78% 的查詢中,正確程式碼的分數甚至低於其對應的錯誤干擾項。

Significance

此研究揭露了當前編碼代理與檢索增強生成(RAG)系統的關鍵弱點:模型過度依賴特徵重合而非理解功能邏輯。釋出的完整資料集、執行預言機與環境快照,為未來提升程式碼檢索的功能判別力提供了重要基礎。