Problem
互動式網頁生成涉及多項功能需求與對應的程式區塊(如事件處理、狀態更新或 CSS 選擇器)。傳統強化學習模型(如 GRPO)常將複雜的結構化結果簡化為單一序列級獎勵,導致權重分配(credit assignment)模糊,難以針對特定的程式碼片段進行精準優化。
Method
研究團隊提出 Rubric-to-Code Credit Assignment (RCCA) 框架,將評分規準(rubric)轉換為局部優化訊號。該方法採用階層式獎勵機制,區分格式、原始碼、運行時及功能性失敗,並將自動評估器產生的文字歸因與具體的程式碼片段及標記(token)進行對齊。
Results
實驗顯示 Ling-RCCA-Flash 在 MiniAppBench 獲得 41.25 分,大幅超越 Ling-3.0-Flash 並領先 Claude Opus 4.5;在 ArtifactsBench 則以 76.19 分超越 GPT-5 的官方紀錄,創下該榜單的新高分,顯示其生成的程式碼更具實作品質。
Significance
此研究證明透過細粒度的評分權重分配,能顯著改善大型語言模型在複雜、多組件程式碼生成任務中的表現。這不僅提升了網頁應用的自動化開發水準,也為強化學習在處理長序列、多需求任務時提供了更精確的優化路徑。