Claude Opus 5 登場:主打長時間自主代理與程式撰寫能力
anthropic.com/news · 2026-07-24
核心規格
Anthropic 於 2026 年 7 月 24 日發布 claude-opus-5,作為 Opus 系列的最新旗艦模型。這次更新的重點是加強長時間執行的自主代理能力,同時提升程式撰寫與專業工作場景的表現。官方定價為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,另提供「Fast 模式」,價格為基礎版兩倍、速度約為預設模式的 2.5 倍。一般存取層級不強制資料保留。
效能表現
Anthropic 公布多項基準測試結果,但多以相對比較呈現而非公開絕對分數。在多個代理型任務基準上,Opus 5 的表現超越或逼近同期最強模型。以下為官方揭露的比較數據:
| 測試項目 | 結果 |
|---|---|
| Frontier-Bench v0.1 | 超越所有其他模型 |
| CursorBench 3.2 | 與 Fable 5 最高分差距在 0.5% 內,成本僅其一半 |
| ARC-AGI 3 | 約為次佳模型的三倍 |
| Zapier AutomationBench | 通過率約為次佳模型的 1.5 倍 |
| OSWorld 2.0 | 超越 Fable 5 最佳成績,成本僅為其三分之一多一點 |
| 有機化學(內部測試) | 較 Opus 4.8 高 10.2 個百分點 |
| 蛋白質預測(內部測試) | 較前代高 7.7 個百分點 |
在應用場景上,Anthropic 舉例 Opus 5 可撰寫電腦視覺處理管線、進行根本原因除錯,並產出較複雜的技術視覺化輸出。官方將這些能力歸因於「更強的代理性與徹底性」,而非單一分數的提升。
影響範圍
安全性方面,Anthropic 的自動化行為稽核給出「整體失準行為」2.3 分,為系列最低(即最佳)。不過在生物研究與攻擊性資安領域,官方坦承Opus 5 仍落後於自家的 Mythos 5,尤其在漏洞利用能力上差距明顯。文件也點出模型在長時間自主研究任務上仍有「重要限制」,並強調此次更新未推進具雙重用途風險的能力。
原始來源:Anthropic 官方公告
Gemini 3.5 Flash Cyber:DeepMind 推出資安專用輕量模型,先供政府與夥伴試行
deepmind.google/blog · 2026-07-21
背景
Google DeepMind 於 2026 年 7 月 21 日發布 Gemini 3.5 Flash Cyber,這是從 Gemini 3.5 Flash 微調而來的輕量模型,專門用於尋找、驗證並修補軟體漏洞。它被整合進 DeepMind 既有的自動化資安代理 CodeMender,由 CodeMender 反覆呼叫此模型分析大量程式碼路徑,再將結果彙整成單一報告。目前僅開放給政府機關與信任夥伴,作為限量試行計畫的一部分,DeepMind 表示會逐步擴大開放範圍。
方法與訓練資料
訓練資料納入 Google 自身的資安基礎設施數據,包括 OSV.dev 超過 70 萬筆開源漏洞紀錄,以及長達十年份的 OSS-Fuzz 模糊測試發現,讓模型學習資安研究員實際的分析流程。方法論上,模型採用「多次呼叫」設計,單次分析最多可呼叫模型 5 次,透過重複的輕量呼叫探索龐大的執行路徑搜尋空間,而非依賴單次高成本的推論。
效能表現
DeepMind 公布多組基準測試結果,顯示該模型以更小的規模達到接近大型模型的表現。在 CyberGym 上,透過多次呼叫設計,其表現可與規模大得多的模型競爭;在 Big Sleep 評測中,於 Chrome 與 Safari 程式碼庫上的表現明顯優於主線的 3.5 Flash 與 3.6 Flash。在 Chrome 正式程式碼庫掃描中也優於標準版 3.5 Flash,DeepMind 並提到部分具安全防護機制的競爭模型選擇不參與比較。
| 模型 | V8 JavaScript 引擎發現的獨立問題數 |
|---|---|
| Gemini 3.5 Flash Cyber | 55 |
| Gemini 3.5 Flash(標準版) | 47 |
| Claude Opus 4.6 | 36 |
影響範圍
由於具備自動找漏洞與修補的能力,DeepMind 目前刻意將存取範圍限縮在政府機關與信任夥伴,透過 CodeMender 的限量試行計畫提供。這種漸進式開放策略反映出雙重用途疑慮:同一套自動化漏洞挖掘能力,既可用於防禦性修補,也可能被用於攻擊性用途,因此存取權限的把關與 CodeMender 的封裝方式同樣重要。
AREX:透過內外雙迴圈實現遞迴自我改進的深度研究代理
arXiv · 2026-07-23
方法
論文 arXiv:2607.21461《AREX: Towards a Recursively Self-Improving Agent for Deep Research》提出的核心觀察是:深度研究任務中,一次找出同時滿足所有限制條件的答案成本很高,但驗證一個候選答案卻能拆解成一連串較簡單的逐條檢查。基於這種「產生與驗證的不對稱性」,AREX 不只是讓代理搜尋更久,而是交替執行兩個迴圈:內層的研究迴圈負責蒐集證據並建構暫定答案;外層的自我改進迴圈則逐條稽核答案是否滿足限制、找出尚未解決的主張,再據此發動針對性的後續研究。為了讓這個遞迴過程能撐過長時間的互動,AREX 額外學習了一個自主的情境更新工具,能把持續增長的互動歷史壓縮成精簡的「改進狀態」,保留已驗證的證據並凸顯尚未解決的限制條件,且不依賴外部模型輔助。
訓練方式與模型規模
訓練分為兩階段:先以驗證過的合成任務與高品質軌跡進行代理式中期訓練(agentic mid-training),再接續長時程強化學習。針對長時程強化學習常見的獎勵稀疏問題,作者特別加強獎勵取得關鍵決定性證據、或糾正錯誤研究方向的步驟。研究團隊實作了兩個規模的模型:一個 4B 參數的密集(dense)模型,以及一個 122B 總參數、啟用 10B(122B-A10B)的混合專家(MoE)模型。
實驗結果
論文在 BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE) 等推理與工具使用基準上進行評測。作者表示 AREX 大幅超越同規模的基準模型,且即便對手模型啟用的參數量遠高於 AREX,AREX 仍維持有競爭力的表現。摘要中並未列出各基準的具體絕對分數,僅以相對優劣描述結果。
限制
從目前可取得的論文摘要來看,作者並未在摘要中明列具體的分項數值或失敗案例,這使外部難以評估 AREX 在各基準上的確切領先幅度,或在哪些限制條件類型上仍會出錯。此外,自主情境更新工具的品質高度依賴訓練所用合成任務與軌跡的覆蓋範圍,若目標任務的限制條件形式在訓練分佈之外,遞迴自我改進迴圈的效果仍有待驗證。