小米 MiMo-V2.6 把 RL 算力放大,單步吃 2.7–3.7B token
Xiaomi MiMo · arXiv 2610.11959 · 2026-10-08 提交
MiMo-V2.6 技術報告把「後訓練階段怎麼把 RL 規模撐上去」寫成一份完整的系統報告,重點不在某個新演算法,而在批次、環境、評分三條軸同時放大,並公開訓練動態、RL 環境與 RL 框架。這是 Xiaomi MiMo 團隊在 arXiv 2610.11959 於 2026-10-08 提交的全模態模型系列報告。
背景:RL 擴大後哪裡會壞
把 RL 當成讓模型自我改進的主要訓練手段,瓶頸多半不在演算法,而在系統與訊號品質。同步訓練時,長程 agent 軌跡長短不一,快的 rollout 要等慢的;環境太單一時,模型容易學會鑽獎勵函數的漏洞;評分若只看單一軌跡,長任務的獎勵訊號又很噪。
報告的出發點就是這三件事:吞吐、環境多樣性、評分準確度。它宣稱要「scale RL compute」,而不是再換一個損失函數。
核心改動:三條擴展軸
依 Hugging Face 論文頁的摘要,第一條軸是更大的批次與更高吞吐,採非同步訓練,每步消耗 1,568 個樣本、2.7–3.7B token,上下文長度最高 1M。
第二條軸是更多元且更複雜的環境,涵蓋程式碼、通用、視覺與 cyber 四類,並混用多種 agent harness。第三條軸是更多評分算力,稱為 groupwise agentic grading,目的是替長程任務給出更準的獎勵,同時把模型推向更短、更省 token 的解法。
| 面向 | 常見做法 | MiMo-V2.6 報告的做法 |
|---|---|---|
| 訓練排程 | 同步等待最慢的 rollout | 非同步訓練,單步 1,568 樣本 |
| 環境 | 單一領域、單一 harness | 程式碼、通用、視覺、cyber,多種 harness |
| 獎勵 | 逐條軌跡評分 | groupwise agentic grading |
上表「常見做法」一欄是對比用的通則描述,不是報告逐項引述;右欄才是頁面所述內容。
穩定性與基礎設施
大規模 RL 的訓練本身容易不穩,報告選擇直接凍結 MoE router,讓路由不再隨更新而變動,並設置多層防禦來對付 reward hacking。基礎設施面則列出統一的軌跡表示、高併發的多框架 rollout、控制面與資料面解耦,以及訓練與推論的一致性。
這些條目在頁面上只有名稱,沒有實作細節。至於使用哪種 RL 演算法、模型參數量、各 benchmark 的分數,摘要頁與 arXiv 摘要頁都未給出,本文也不補寫。
報告同時說明模型建立在預訓練好的 hybrid-SWA 架構之上,並先以廣泛的多模態語料做 mid-training,之後才進入上述 RL 階段。換句話說,RL 規模的放大是疊在既有底座上,而不是從零重做預訓練;底座的規模與資料量,頁面同樣沒有給數字。
影響範圍
自己做 agentic RL 的團隊最值得看的是報告承諾開源的三樣東西:訓練動態、RL 環境、RL 框架。若環境與框架如期釋出,跑長上下文、多 harness 混訓的人可以直接對照自己的非同步排程與 reward hacking 防線。
想評估模型能力的人目前還不能下結論,因為頁面沒有公布任何評測分數;模型權重則列在 Hugging Face collection,授權與規格請以該頁為準。Hugging Face 論文頁也沒有列出程式碼倉庫連結,「開源」目前只是摘要中的陳述,要等實際釋出再確認內容。
另一個值得追的點是「更短、更省 token」這個設計目標。若評分器真的偏好短解,長程 agent 的推論成本會跟著降,但報告摘要沒有給出對應的 token 用量變化,這部分論文未公布。