Problem

大型語言模型在推理時若未配備檢索系統(RAG),往往難以精確回答關於特定封閉文件集的相關問題。將固定語料庫有效轉化為模型內部的可用參數化知識,並在「免檢索」的前提下維持問答品質,是當前模型訓練的一大挑戰。

Method

研究團隊提出了 IAR(Inject, Align, Recover)三階段後訓練框架。首先透過「注入」階段將源文件轉換為續寫、重寫與指令制約的重構任務;接著在「對齊」階段利用僅含答案的問答監督來調整模型行為;最後在「恢復」階段將領域適應後的模型與基礎指令模型合併,以找回流失的通用能力。

Results

在涵蓋 Llama、Phi、Qwen 與 SmolLM 等多個模型的實驗中,IAR 在網域內問答準確度平均提升了 3.6 個百分點。更重要的是,在維持通用能力方面表現優異,於 IFEval、MMLU 及 MSBench 等測試指標上,較傳統微調方法平均提升了 12.1 個百分點。

Significance

本研究為如何讓大型語言模型有效吸收特定領域知識提供了系統化的路徑,證明了透過分階段的後訓練策略,模型可以在不依賴檢索系統的情況下,同時掌握深層的專業文件知識與廣泛的通用指令處理能力。