Reflection 推出 501B 開放權重模型 Beam
Reflection AI 官方部落格 · 2026-10-05
Reflection 發表了第一個開放權重模型 Beam:總參數 501B、每個 token 只啟用 23B 的稀疏 MoE,目標是用比大型開放模型少得多的推論運算量,換到接近的 coding 與 agent 表現。但權重還沒放出,官方只說會在本月稍後釋出權重、技術報告與 model card,目前僅開放登記搶先使用。
原本的問題
開放權重陣營裡,表現最好的模型多半更大,官方提到 Qwen 3.8-Max 屬於 2T 以上,每個 token 的推論成本高。Beam 想壓低的正是這一塊:同樣的任務用更少推論運算完成。
官方的定位很直接:Beam 與 GLM 5.2 相比有競爭力,在 coding 與 agent 任務上接近 Qwen 3.8-Max;Kimi K3 這類前沿開放模型的原始能力仍然更強,Beam 的優勢在推論效率。
核心改動
- 架構:501B 總參數、23B 啟用,52 層,交錯使用局部與全域注意力,搭配細粒度的 routed experts。
- 預訓練:23.8 兆 token,在 6,144 張 NVIDIA GB300 NVL72 GPU 上不到四週完成。中途有九次半自動 rewind,後段 goodput 達 92.3%。
- 強化學習:10.5K 張 GB300 跑四週,產生超過 1 億條 rollout,最大上下文 256K token。
RL 的做法
Reflection 採用完全非同步的 policy gradient。非同步的老問題是 policy staleness:長 rollout 裡的 token 由不同版本的 checkpoint 產生,越早的 token 離現在的 policy 越遠,訓練容易發散。官方說新演算法讓學習用的樣本即使是一天前產生的(落後 107 個權重版本),訓練仍然穩定。
基礎設施面有幾個可驗證的數字:
- 平均同時 110K 條 rollout,最高 170K 個並行 sandbox,整個訓練與評分用掉約 13 億個 sandbox。
- 新權重到推論機群的中位時間約 12 秒;階層式分發讓跨機櫃流量少 75%,全機群更新快 2.2 倍。
另一個細節是可控的長度懲罰:獎勵答對的解法、懲罰多餘 token。訓練初期 completion 變短、成績反而變好;後期 agent 能力增強後長度回升,但多出的 token 換到更高分。使用者可以用 reasoning effort 參數調整,低設定回答較短,高設定用更長推理換難題的表現。
資料與環境
官方強調任務品質比數量重要:RL 環境池接近一百萬個,主要靠合成資料產生,再補上廠商資料與開源資料,並依難度與品質反覆過濾,剔除說明不清、可被猜中或可被投機取巧的任務。官方說,資料品質一打折,能力就會停滯。
預訓練資料約 95% 的原始網路 token 在解析、去重與篩選時被丟掉,同時保留了一般過濾方法會漏掉的約 1.8 兆 token。這些說明都是官方自述,技術報告釋出前無法獨立驗證。
基準數字與效率主張
| 基準 | Beam | GLM 5.2 | Kimi K3 |
|---|---|---|---|
| SWE Bench Pro v1 | 65.5 | 62.1 | 未公布 |
| Terminal Bench v2.1 | 80.1 | 81.0 | 88.3 |
| HLE(無工具) | 36.2 | 40.5 | 46.9 |
| GPQA Diamond | 90.5 | 91.2 | 93.5 |
數字取自官方基準圖表,由 Reflection 自行彙整。官方宣稱在進階推理基準上與 GLM-5.2 分數相當,但推論運算少 3 到 4 倍。這個比較用的是估算:FLOPs ≈ 2 × 啟用參數量 × 每次嘗試的平均生成 token 數,官方自己也說這只是近似比較,不是實測成本。
影響範圍
想自架 coding agent 的團隊:權重釋出後,要評估的是 23B 啟用參數的實際服務成本,但 501B 的總參數仍要全部放進記憶體,這點官方文章沒有給出部署需求,請等 model card。Beam 只支援文字輸入。
用 API 與 agent 框架的人:reasoning effort 是調成本的旋鈕,同一個模型可以在短答與長推理之間切換,成本評估應該以「每個任務的總 token」而不是單價來算。
看 benchmark 的人:官方表格有大量「未報告」格子,同列對手並不齊全;Terminal Bench 與 HLE 上 Beam 明顯落後 Kimi K3。授權條款、權重格式、量化版本與推論引擎支援,官方文章都未說明。