Problem
多導師在線蒸餾(M-OPD)常面臨「能力整合缺口」,導致通用模型難以完整吸收各領域專家的知識。研究發現,此失敗並非源於梯度衝突,而是由於跨領域序列長度不一、動態收斂漂移及非同步更新導致的獎勵過時,共同造成權杖級(token-level)優化預算的嚴重分配失衡,使特定任務效能提早停滯。
Method
開發 Open-MOPD 框架,透過三項核心機制系統性修復失衡:權杖份額平衡、差距感知動態預算分配,以及學生獎勵實時刷新。此機制確保了不同領域在優化過程中的資源權重一致,並解決了因策略更新非同步而產生的獎勵資訊過時問題。
Results
在 SmolLM3-3B-Base 的基準測試中,標準 M-OPD 僅能達到專家集成性能的 35.6%,而使用 Open-MOPD 後,單一學生模型的效能恢復率躍升至 83.4%。該方法顯著改善了指令遵循等任務的效能退化,讓模型在多領域整合上表現更均衡。
Significance
此研究為多領域強化學習提供了具理論支持且高度可重現的優化路徑。透過完全開源的後訓練配方與低硬體門檻的訓練軌跡,讓學術單位能以有限的資源開發高品質的通用型語言模型,推動了開源社群在大型語言模型對齊技術上的進步。