Problem

高難度的奧林匹亞數學競賽對 AI 而言極具挑戰性,傳統方法往往需依賴形式化證明器(如 Lean)或外部運算工具。如何在純自然語言的框架下,讓大型語言模型產生具備嚴謹邏輯且達到金牌水準的證明過程,是目前人工智慧推理領域的核心瓶頸。

Method

研究團隊基於 Nemotron 3 Ultra,透過監督式微調(SFT)與強化學習(RL)訓練出專業化模型。系統採用一套測試時運算(Test-time compute)流水線,透過「生成、驗證、修正」的迭代搜索流程處理問題。整個過程完全不使用形式化語言、外部工具或網路連結,純粹依靠自然語言模型進行推理與篩選。

Results

該系統在 IMO 2026 評測中取得 30 分(滿分 42 分)的優異成績,成功達到金牌獲獎門檻。團隊同步釋出了兩款後置訓練模型、訓練與推理程式碼、提交的解題過程,以及包含 200 道原創奧數題目的全新基準測試 Nemotron-IMO-Bench。

Significance

這項研究證明了即便不具備符號邏輯工具,僅靠後置訓練最佳化與測試時運算的分配,AI 就能在複雜的數學推理任務中達到頂尖人類水準。這套開源方案為研究社群提供了完整的技術路徑,將顯著推動大語言模型在嚴謹科學領域的應用發展。