Amazon公開千億模型的完整八階段訓練配方與獎勵設計
arXiv:2609.29421 · 2026-09-26
Rufus-Air 把一個從基礎模型端到端訓練成可用聊天與 agent 模型的完整流程攤開——八個訓練階段各自用什麼資料、reward 怎麼設計、為何某幾個階段要換掉標準 RL 演算法,全部寫在論文裡,不是摘要式帶過。作者是 Amazon Rufus 團隊的 Priyanka Nigam、Bing Yin 等共二十二人,論文arxiv:2609.29421於二〇二六年九月二十四日提交至 arXiv。整套配方建立在 GLM-4.5-Air-Base(106B-A12B)之上,且只用公開資料與開源工具鏈,沒有新增人工標註,也不依賴專有蒸餾教師模型。
背景:post-training 一直是黑箱
主流大模型公司公布的技術報告通常只寫「我們做了 SFT 和 RLHF」,卻很少揭露每個 RL 階段用了哪些資料集、reward 怎麼設計、遇到 reward hacking 又如何處理。想重現一條完整的 post-training pipeline,工程團隊常常得拼湊零散論文與社群討論,而且多半只涵蓋單一階段,例如只講數學 RL 或只講 RLHF。Rufus-Air 罕見地把從 SFT 到 RLHF 的八個階段全部串起來公開,包括階段之間如何銜接、資料量與 checkpoint 選擇的取捨。
核心細節:Reasoning RL 與 Search Agent
Reasoning RL 階段用十二萬一千一百六十一筆數學、科學與益智題目訓練,reward 由 Math-Verify 與 Python checker 做可驗證判定,並套用「learnability filtering」:直接丟掉模型已經能解對超過 0.8 機率、或完全解不出來的題目,只保留學得到的難度區間。因為 MoE 模型的長 rollout 在標準 GRPO 下容易不穩定,這個階段改用 GSPO(Group Sequence Policy Optimization),把 importance ratio 與 clipping 放到整個序列層級計算,而非 token 層級。
Search Agent 階段訓練模型做長迴合網頁研究:兩千兩百題(從三萬六千六百題篩選而來)要求模型反覆呼叫搜尋與網頁擷取工具,單一任務最多可呼叫一百次工具,reward 由 LLM judge 給分。Coding Agent 階段則用 Endless-Terminal、SETA-Env、Scale-SWE 等資料源,訓練約四千個終端機與軟體工程任務,直接執行 shell 指令拿到 reward。RLHF 階段用七萬五千八百一十五筆 HH-RLHF prompt,對 Skywork-Reward-V2-Qwen3-8B 訓練並加上長度懲罰,避免模型為了拿高分而灌水字數。
| 階段 | 一句話說明 |
|---|---|
| SFT | 用九百萬筆、十七個公開資料集訓練通用對話、STEM、數學與程式基礎能力 |
| Reasoning RL | 可驗證獎勵 + learnability filtering,訓練數學/科學/益智推理 |
| Coding RL | 對兩萬九千餘題競賽程式用執行結果當 reward |
| Instruction-Following RL | 多限制、多輪指令搭配 rubric 式二元 reward |
| General Agent | 在一千個合成 MCP 環境裡訓練工具呼叫能力 |
| Coding Agent | 終端機與軟體工程任務,直接執行 shell 指令取得 reward |
| Search Agent | 長迴合網頁搜尋研究,最多一百次工具呼叫,LLM judge 評分 |
| RLHF | 對人類偏好資料訓練,加長度懲罰控制簡潔度 |
影響範圍:誰該拿這份配方對照
對正在自建 post-training pipeline 的團隊而言,這篇論文提供的不只是流程圖,而是可以逐項核對的設計決策:reward 該用可驗證判定還是 LLM judge、MoE 模型該用哪種 RL 演算法穩定訓練、agent 類任務的環境規模與工具呼叫上限怎麼定。負責 reward 設計與 agent、coding RL 階段的團隊尤其可以直接拿論文裡的 filtering 規則與 reward 設計做基準比對,例如 learnability filtering 的篩選邏輯、DAPO 只保留 group 平均 reward 落在 (0, 0.8] 這個「有效帶」的做法、以及 RLHF 階段避免字數灌水的長度懲罰設計。論文也附上與官方 GLM-4.5-Air 後訓練版本的評測對照,IFEval、LiveCodeBench v6、SWE-bench Verified 等指標都有具體分數可查,方便直接對照數字而非只憑印象判斷這套配方值不值得參考。
原始來源:arXiv:2609.29421 — Rufus-Air: An Open LLM Post-Training Recipe