Problem

現有的測試時訓練(TTT)方法通常採用硬編碼(hard-code)實現,導致各項設計維度被混淆。這使得研究者難以獨立評估不同組件(如損失函數、學習率、架構)對模型性能的具體貢獻,也阻礙了開發新型 TTT 變體的效率與靈活性。

Method

研究團隊開發了 Modular TTT 框架,將內層學習器(inner learner)表示為有向無環圖(DAG)。該框架將快速權重網路、損失函數、學習率、權重衰減及歸一化設為明確的設計維度,並能自動將原始層級的訓練視圖前向、後向傳播與因果查詢視圖規則,組合成完整的圖級 TTT 運算與狀態轉移。

Results

透過系統化消融實驗發現,較小的學習率初始化、權重衰減與單層非線性結構能顯著提升效能,而 MSE 與內積損失函數表現相近。相反地,深層快速權重網路與歸一化會因引發過大激活值而損害表現。基於此發現訓練出的 1.45B 參數模型,在基準測試中展現出與 Gated DeltaNet 相當的優異效能。

Significance

此研究為 TTT 模型建立了統一且靈活的設計典範,釐清了影響性能的關鍵架構因素。透過模組化方法,研究者能更精確地優化序列建模技術,為推動更高效、可擴展的線上學習模型奠定了重要理論與實作基礎。