AI 前沿 2026 年 7 月 25 日

2026-07-25 — Anthropic 推出 Claude Opus 5,NVIDIA 團隊修復 SOAP/Muon 優化器大批次不穩定問題

primary=https://www.anthropic.com/news/claude-opus-5 primary=https://arxiv.org/abs/2607.20548

Anthropic 發布 Claude Opus 5,ARC-AGI 3 領先次佳模型三倍

Anthropic · 2026-07-24

2026 年 7 月 24 日,Anthropic 發布新一代旗艦模型 Claude Opus 5(模型代號 claude-opus-5),同步開放於 Claude API、Claude.ai、Claude Code 與 Claude Cowork。這是繼 Opus 4.8 之後 Opus 系列的最新版本,官方公告以多項基準測試數字說明其相對前代與同業模型的提升幅度。

規格與定價

API 定價為輸入 $5 / 百萬 token、輸出 $25 / 百萬 token。官方另提供 Fast 模式,速度約為預設模式的 2.5 倍,但價格為基礎價的兩倍。公告未揭露具體的上下文視窗長度數字。

核心改動:基準測試表現

Anthropic 公布的比較數據集中在與 Opus 4.8 及其他模型的差距:

  • Frontier-Bench v0.1:超過 Opus 4.8 分數兩倍以上
  • ARC-AGI 3:達到次佳模型的 三倍 分數
  • Zapier AutomationBench:通過率為次佳模型的 1.5
  • 有機化學任務:較次佳模型高出 10.2 個百分點
  • 蛋白質相關預測任務:較次佳模型高出 7.7 個百分點

公告同時列出在 CursorBench 3.2、OSWorld 2.0、GDPval-AA v2、HLEAutomationBench、DeepSearchQA 等基準上維持領先,但未提供對應的具體分數。新增功能包括對話進行中途更換工具集(beta)、模型不可用時自動切換至替代模型(beta),以及強化的視覺生成與 artifact 產出能力。

影響範圍

安全性方面,Anthropic 稱 Opus 5 依自動化行為稽核為「至今最一致(aligned)的模型」,在整體「misaligned behavior」評分為 2.3;但在網路安全攻擊利用(cybersecurity exploitation)項目上仍落後於另一款稱為 Mythos 5 的模型。完整安全評估發布於對應的 System Card。此次發布將 Opus 定位為鎖定編碼、自動化工具串接與複雜代理任務的最高階模型,定價區間也高於前代。

原始來源:Anthropic 官方公告


NVIDIA 團隊修復 SOAP 優化器大批次訓練不穩定問題,Muon 對照組加速收斂

arXiv (cs.LG/cs.AI) · 2026-07-13

NVIDIA 研究團隊(含 Bryan Catanzaro、Mohammad Shoeybi 等作者)於 2026 年 7 月 13 日提交論文《SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales》(arXiv:2607.20548),針對高階優化器 SOAP 與 Muon 在大規模預訓練中的數值不穩定問題提出修正,並釋出對應程式碼庫。

背景:為何需要高階優化器

目前主流的 AdamW 優化器僅使用梯度的一階動量做逐元素縮放,而 SOAP、Muon 這類高階優化器會對整個權重矩陣做結構性處理。Muon(全名 Momentum Orthogonalized by Newton-Schulz)用 Newton-Schulz 迭代對動量矩陣做正交化,將梯度矩陣的所有奇異值歸一為 1,直覺上是把更新方向「拉直」成正交矩陣而非放大單一方向;SOAP 則是基於 Shampoo 的二階近似,用可旋轉的特徵基底(eigenbasis)對梯度做前處理。兩者過去因計算成本與大批次下的數值穩定性問題而未被大規模採用。

核心改動:修 SOAP 的「slingshot」不穩定

論文指出 SOAP 過去每隔約 10 步才更新一次特徵基底,導致在大批次訓練時基底相對於快速變化的損失曲面變得過時,引發「slingshot」效應——權重梯度範數先震盪、隨後語言模型損失出現尖峰。團隊的修正是把特徵基底重算頻率提高到每一步都用 QR 分解,並導入 KL-Shampoo 的協方差估計法,把 Kronecker 因子的條件數(condition number)降到標準 Shampoo 的平方根,藉此改善特徵分解時的數值穩定性。

規格細節:測試規模與結果

  • 測試架構:8B 密集 GPT、3B 啟用 / 30B 總參數 MoE、8B 啟用 / 72B 總參數的 Mamba-Transformer 混合 MoE
  • 全域批次大小最高測到 1 億 token(對照基準為 2500 萬 token)
  • 訓練資料使用 1T 與 3T token 兩種子集
  • 在 8B 混合 MTP 模型、兩倍批次設定下:Muon 的 HumanEval 為 65.79,AdamW 為 57.62;MMLU 則為 74.8974.59

為公平比較不同優化器,團隊採用「update-RMS matching」方法,讓各優化器的參數更新維持相同均方根範數;SOAP 與 AdamW 因旋轉矩陣不改變範數而天然一致,Muon 則需額外乘上約 0.2 的動量阻尼修正係數才能對齊。

影響範圍

團隊將實作以 Megatron-LM 相容的方式釋出於 github.com/NVIDIA-NeMo/Emerging-Optimizers,內含 SOAP、Muon 及實驗性變體的分散式實作。論文結論顯示,在測試規模內 SOAP 與 Muon 皆持續優於 AdamW,且可在更大批次下維持穩定,為後續更大規模預訓練的優化器選型提供了可直接落地的參考實作。

原始來源:arXiv:2607.20548NVIDIA-NeMo/Emerging-Optimizers (GitHub)


End of article
0
Would love your thoughts, please comment.x
()
x