Problem
現有的搜尋評估系統主要關注個別文件的相關性,並透過 nDCG 等指標進行加總,卻忽略了文件集內部的互動關係(如冗餘、衝突與互補性)。這導致系統無法有效回答為何某個文件組合優於另一個,進而限制了以大型語言模型(LLM)為核心的下游任務生成上限。
Method
研究團隊開發了 SetwiseEvalKit 評估基準,涵蓋 3 個層級、9 個維度及約 2.8 萬條高品質評分量表(rubrics),適用於短文本與長文本情境。此外,提出 Rubric4Setwise 無需訓練的框架,能將這些量化準則轉化為文件集選擇信號,直接導引檢索結果的優化。
Results
實驗分析 12 款重排序器(rerankers)後發現,即使是表現最佳的方法,其覆蓋率也不超過 45%,且在跨文件協調維度普遍表現疲弱。相較之下,Rubric4Setwise 是唯一在各種情境下均維持領先性能的方法,能以更少的文件數量與搜尋輪次,達成最優的下游生成效果。
Significance
這項研究將檢索技術從「相關性中心」轉向「文件集品質中心」,為 AI 代理人與 RAG 系統提供了更精確的評估與診斷工具。透過閉環式的優化流程,成功解決了檢索評分與生成需求之間的斷層,為搜尋引擎的未來演進提供了重要理論支撐。