Problem
層丟棄(Layer Dropout,又稱隨機深度)技術過去在變換器模型中能提升訓練速度與魯棒性,但隨著模型規模擴張,當前的 LLM 預訓練流程卻逐漸棄用此技術。主因是部分報告指出它會損害準確率,且學界缺乏系統性研究來量化並解決此問題。
Method
研究團隊在 Cerebras CS-3 系統上進行了超過 2400 次訓練實驗,模型參數範圍從 2.7 億至 82 億。他們開發出一套最佳實踐方案,精確優化了層分佈、時間排程及優化器超參數,並將此技術應用於後訓練階段的層級跳過與自我投機解碼。
Results
實驗證明,在相同訓練算力(FLOPs)下,使用層丟棄可獲得更低的損失值。若追求相同驗證損失,則能節省高達 25% 的訓練資源。此外,該技術支援早期退出與中間層跳過等優化,使推論速度提升 1.5 倍,且幾乎不影響準確率。
Significance
這項研究重新確立了層丟棄在大規模訓練中的核心地位,打破了其在 LLM 時代無效的迷思。它不僅提供了一套可擴展的訓練框架,更為模型在推論階段的動態優化與加速開闢了極具成本效益的新路徑。