Problem

目前的自主資料科學代理程式高度依賴「試錯」的工作流程,這意味著在做決定前必須進行大量且昂貴的實體運算。這種計算資源的高耗損,限制了代理程式在處理複雜任務時的效率與即時性。

Method

研究團隊開發了 DSWorld 框架,透過模擬環境狀態轉換來預測操作結果。該框架結合了結構化狀態建構、成本感知路由、輕量級真實執行,以及針對高耗能運算的 LLM 模擬器。此外,研究者建構了 8K 規模的轉換軌跡數據集,並引入「反思性世界模型優化」(RWMO)強化學習策略來提升預測精準度。

Results

實驗數據顯示,DSWorld 能將強化學習代理程式的訓練速度提升約 14 倍,並將搜尋推理速度提高 3 至 6 倍。在轉換預測任務中,其表現優於目前最強的 LLM 基準模型達 35.6%,且同時維持了極佳的決策品質。

Significance

這項研究為自主資料科學代理程式提供了更高效的運作典範。透過建立準確的世界模型,AI 不再需要盲目執行每項指令,而是能先「預見」結果,這對於降低自動化資料科學的硬體門檻與縮短開發週期具有重大貢獻。