AI 前沿 2026 年 10 月 10 日

2026-10-10 — 小米 MiMo-V2.6 把 RL 算力放大,單步吃 2.7–3.7B token

primary=https://arxiv.org/abs/2610.11959 primary=https://huggingface.co/papers/2610.11959

小米 MiMo-V2.6 把 RL 算力放大,單步吃 2.7–3.7B token

Xiaomi MiMo · arXiv 2610.11959 · 2026-10-08 提交

MiMo-V2.6 技術報告把「後訓練階段怎麼把 RL 規模撐上去」寫成一份完整的系統報告,重點不在某個新演算法,而在批次、環境、評分三條軸同時放大,並公開訓練動態、RL 環境與 RL 框架。這是 Xiaomi MiMo 團隊在 arXiv 2610.11959 於 2026-10-08 提交的全模態模型系列報告。

背景:RL 擴大後哪裡會壞

把 RL 當成讓模型自我改進的主要訓練手段,瓶頸多半不在演算法,而在系統與訊號品質。同步訓練時,長程 agent 軌跡長短不一,快的 rollout 要等慢的;環境太單一時,模型容易學會鑽獎勵函數的漏洞;評分若只看單一軌跡,長任務的獎勵訊號又很噪。

報告的出發點就是這三件事:吞吐、環境多樣性、評分準確度。它宣稱要「scale RL compute」,而不是再換一個損失函數。

核心改動:三條擴展軸

依 Hugging Face 論文頁的摘要,第一條軸是更大的批次與更高吞吐,採非同步訓練,每步消耗 1,568 個樣本、2.7–3.7B token,上下文長度最高 1M。

第二條軸是更多元且更複雜的環境,涵蓋程式碼、通用、視覺與 cyber 四類,並混用多種 agent harness。第三條軸是更多評分算力,稱為 groupwise agentic grading,目的是替長程任務給出更準的獎勵,同時把模型推向更短、更省 token 的解法。

面向常見做法MiMo-V2.6 報告的做法
訓練排程同步等待最慢的 rollout非同步訓練,單步 1,568 樣本
環境單一領域、單一 harness程式碼、通用、視覺、cyber,多種 harness
獎勵逐條軌跡評分groupwise agentic grading

上表「常見做法」一欄是對比用的通則描述,不是報告逐項引述;右欄才是頁面所述內容。

穩定性與基礎設施

大規模 RL 的訓練本身容易不穩,報告選擇直接凍結 MoE router,讓路由不再隨更新而變動,並設置多層防禦來對付 reward hacking。基礎設施面則列出統一的軌跡表示、高併發的多框架 rollout、控制面與資料面解耦,以及訓練與推論的一致性。

這些條目在頁面上只有名稱,沒有實作細節。至於使用哪種 RL 演算法、模型參數量、各 benchmark 的分數,摘要頁與 arXiv 摘要頁都未給出,本文也不補寫。

報告同時說明模型建立在預訓練好的 hybrid-SWA 架構之上,並先以廣泛的多模態語料做 mid-training,之後才進入上述 RL 階段。換句話說,RL 規模的放大是疊在既有底座上,而不是從零重做預訓練;底座的規模與資料量,頁面同樣沒有給數字。

影響範圍

自己做 agentic RL 的團隊最值得看的是報告承諾開源的三樣東西:訓練動態、RL 環境、RL 框架。若環境與框架如期釋出,跑長上下文、多 harness 混訓的人可以直接對照自己的非同步排程與 reward hacking 防線。

想評估模型能力的人目前還不能下結論,因為頁面沒有公布任何評測分數;模型權重則列在 Hugging Face collection,授權與規格請以該頁為準。Hugging Face 論文頁也沒有列出程式碼倉庫連結,「開源」目前只是摘要中的陳述,要等實際釋出再確認內容。

另一個值得追的點是「更短、更省 token」這個設計目標。若評分器真的偏好短解,長程 agent 的推論成本會跟著降,但報告摘要沒有給出對應的 token 用量變化,這部分論文未公布。

原始來源:arXiv 2610.11959、Hugging Face 論文頁、MiMo-V2.6 部落格


End of article
0
Would love your thoughts, please comment.x
()
x