Problem
大型語言模型在擴展參數規模時,面臨計算負擔沈重、專家特化程度不足以及超長上下文訓練不穩定等技術瓶頸,且現有稀疏模型架構在細粒度表達能力與推理效率之間往往難以取得理想平衡。
Method
採用僅解碼器的 MoE 架構,擁有 314B 總參數並具備 384 個細粒度專家。核心創新為「群組微分延遲注意力」(GDLA),結合了微分注意力與多頭延遲注意力的壓縮技術。此外,引入流形約束超連接、專家專用 PolyNorm 激活函數與多代幣預測技術,並透過 12.5T 資料預訓練及多導師在線蒸餾(MT-OPD)進行優化。
Results
Motif 3 在數學推理、科學知識及程式開發等評測中展現與頂尖開源模型抗衡的實力。其支援高達 256K 的上下文長度,在長程代理任務(agentic tasks)與幻覺敏感評測中表現優異,成功整合了邏輯推理、工具調用與指令遵循等多樣化專業能力。
Significance
本研究證明透過細粒度稀疏架構與先進的注意力機制優化,可在維持低運算成本的同時,顯著提升超大規模模型的訓練穩定性與專家特化性能,為開發高效能、低延遲的開源大型語言模型提供了新的技術路徑。