AI 前沿 2026 年 10 月 7 日

2026-10-07 Reflection 推出 501B 開放權重模型 Beam

primary=https://reflection.ai/blog/introducing-beam

Reflection 推出 501B 開放權重模型 Beam

Reflection AI 官方部落格 · 2026-10-05

Reflection 發表了第一個開放權重模型 Beam:總參數 501B、每個 token 只啟用 23B 的稀疏 MoE,目標是用比大型開放模型少得多的推論運算量,換到接近的 coding 與 agent 表現。但權重還沒放出,官方只說會在本月稍後釋出權重、技術報告與 model card,目前僅開放登記搶先使用。

原本的問題

開放權重陣營裡,表現最好的模型多半更大,官方提到 Qwen 3.8-Max 屬於 2T 以上,每個 token 的推論成本高。Beam 想壓低的正是這一塊:同樣的任務用更少推論運算完成。

官方的定位很直接:Beam 與 GLM 5.2 相比有競爭力,在 coding 與 agent 任務上接近 Qwen 3.8-Max;Kimi K3 這類前沿開放模型的原始能力仍然更強,Beam 的優勢在推論效率。

核心改動

  • 架構:501B 總參數、23B 啟用,52 層,交錯使用局部與全域注意力,搭配細粒度的 routed experts。
  • 預訓練:23.8 兆 token,在 6,144 張 NVIDIA GB300 NVL72 GPU 上不到四週完成。中途有九次半自動 rewind,後段 goodput 達 92.3%。
  • 強化學習:10.5K 張 GB300 跑四週,產生超過 1 億條 rollout,最大上下文 256K token。

RL 的做法

Reflection 採用完全非同步的 policy gradient。非同步的老問題是 policy staleness:長 rollout 裡的 token 由不同版本的 checkpoint 產生,越早的 token 離現在的 policy 越遠,訓練容易發散。官方說新演算法讓學習用的樣本即使是一天前產生的(落後 107 個權重版本),訓練仍然穩定。

基礎設施面有幾個可驗證的數字:

  • 平均同時 110K 條 rollout,最高 170K 個並行 sandbox,整個訓練與評分用掉約 13 億個 sandbox。
  • 新權重到推論機群的中位時間約 12 秒;階層式分發讓跨機櫃流量少 75%,全機群更新快 2.2 倍。

另一個細節是可控的長度懲罰:獎勵答對的解法、懲罰多餘 token。訓練初期 completion 變短、成績反而變好;後期 agent 能力增強後長度回升,但多出的 token 換到更高分。使用者可以用 reasoning effort 參數調整,低設定回答較短,高設定用更長推理換難題的表現。

資料與環境

官方強調任務品質比數量重要:RL 環境池接近一百萬個,主要靠合成資料產生,再補上廠商資料與開源資料,並依難度與品質反覆過濾,剔除說明不清、可被猜中或可被投機取巧的任務。官方說,資料品質一打折,能力就會停滯。

預訓練資料約 95% 的原始網路 token 在解析、去重與篩選時被丟掉,同時保留了一般過濾方法會漏掉的約 1.8 兆 token。這些說明都是官方自述,技術報告釋出前無法獨立驗證。

基準數字與效率主張

基準BeamGLM 5.2Kimi K3
SWE Bench Pro v165.562.1未公布
Terminal Bench v2.180.181.088.3
HLE(無工具)36.240.546.9
GPQA Diamond90.591.293.5

數字取自官方基準圖表,由 Reflection 自行彙整。官方宣稱在進階推理基準上與 GLM-5.2 分數相當,但推論運算少 3 到 4 倍。這個比較用的是估算:FLOPs ≈ 2 × 啟用參數量 × 每次嘗試的平均生成 token 數,官方自己也說這只是近似比較,不是實測成本。

影響範圍

想自架 coding agent 的團隊:權重釋出後,要評估的是 23B 啟用參數的實際服務成本,但 501B 的總參數仍要全部放進記憶體,這點官方文章沒有給出部署需求,請等 model card。Beam 只支援文字輸入。

用 API 與 agent 框架的人:reasoning effort 是調成本的旋鈕,同一個模型可以在短答與長推理之間切換,成本評估應該以「每個任務的總 token」而不是單價來算。

看 benchmark 的人:官方表格有大量「未報告」格子,同列對手並不齊全;Terminal Bench 與 HLE 上 Beam 明顯落後 Kimi K3。授權條款、權重格式、量化版本與推論引擎支援,官方文章都未說明。

原始來源:Reflection:Introducing Beam


End of article
0
Would love your thoughts, please comment.x
()
x