Anthropic 發表 Claude Fable 5.1 與 Mythos 5.1:同一顆模型、雙重安全閥門的命名分流
anthropic.com · 2026-09-01
Anthropic 於 2026 年 9 月 1 日發表 Claude Fable 5.1 與 Claude Mythos 5.1,官方說明兩者「是同一個模型,只是安全防護層級不同」。API 模型代號統一為 claude-fable-5-1,已同步上架 Claude.ai、Claude API 以及 AWS、Google Cloud、Microsoft Azure 三大雲端平台。這次更新的重點落在代理式(agentic)長情境作業、程式除錯與科學研究能力。
核心改動:跑分全面對比 Fable 5 與 Opus 5
官方公布的內部評測顯示,新版在多項代理式與推理基準上都超越前代與同代旗艦模型。以下數字皆為 Anthropic 自行測得:
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% |
| Humanity's Last Exam(無工具) | 60.9% | 57.8% | 56.6% |
| OSWorld 2.0(partial) | 77.9% | 72.9% | 75.4% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% |
| AutomationBench | 31.4% | 17.1% | 26.9% |
其中 Terminal-Bench-Science 0.1 的進步幅度最大,從 Fable 5 的 24.7% 跳到 52.6%,反映官方強調的「科學研究能力」提升方向。AutomationBench 分數也接近翻倍,對應長情境代理任務的處理能力。
規格細節:定價與安全分流機制
計費維持每百萬輸入 token US$10、輸出 US$50,但 快取讀取價格從舊制下砍 75%,降到每百萬 token US$0.25。官方換算典型工作負載成本較 Fable 5 降低約 25%,若是高度代理式的工作流程,成本降幅最高可達 45%。
Fable 與 Mythos 的分流本質是安全防護等級的不同開關:一般管道走 Fable 5.1,較低防護版本的 Mythos 5.1 則搭配 Cyber Verification Program(網路安全驗證計畫)與 Life Sciences Verification Program(生命科學驗證計畫),供防禦性資安研究與生醫研究人員申請使用,例如允許漏洞探勘(vulnerability discovery,非漏洞利用開發)等原本受限的操作。Anthropic 表示資安防護的誤判率(false positive)較先前下降 60%。
影響範圍:企業資料控管與科學實測案例
企業客戶另可申請 Enterprise Frontier Safeguards(EFS),將資料儲存權限交還客戶自行控管,預計 2026 年秋季陸續開放。產品線涵蓋 Claude Code、Claude Enterprise、Claude Platform,以及三大雲端的代理平台版本(Amazon Bedrock、Google Agent Platform、Microsoft Foundry)。
官方也附上幾項科學應用實測數字:蛋白質結合體(protein binder)設計在 12 個目標上的命中率接近 50%,相較業界典型的 10–15% 明顯提升;金星地形高程建模解析度從 10–20 公里提升到 2–3 公里;部分深度學習模型的運算最佳化可帶來最高 2.5 倍 GPU 加速。
原始來源:Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1
Google 為 Gemini 導入代理式影片理解:不再固定幀率抽樣,改由模型自主決定看哪一段
blog.google · 2026-09-01
Google 於 2026 年 9 月 1 日在 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 三個模型上發表代理式影片理解(agentic video understanding)功能。開發者只需在 API 呼叫中加入 "processing": "agentic" 參數即可啟用,透過 Google AI Studio 與 Gemini Enterprise Agent Platform 立即可用。此功能鎖定長影片內容的搜尋與分析場景。
核心改動:模型自主決定取樣方式
傳統影片理解以固定幀率逐格處理,代理式模式則讓模型動態搜尋、掃描並檢視特定影片片段,同時跨視覺畫面、音訊與逐字稿三種模態運作。官方描述模型會依查詢內容自行判斷要分析哪一段、用什麼播放速度、透過哪一種模態切入,而非無差別地處理整段影片。
這個機制對長篇內容(10 分鐘到數小時的錄影)效益最明顯,因為固定幀率抽樣在長影片上會浪費大量 token 在不相關畫面。
規格細節:token 與準確率的實測落差
官方公布與固定幀率處理相比的效能數字:token 消耗最高減少 88%,成本最高降低 66%,準確率最高提升 7%。計費本身沿用既有 Gemini API 標準 token 定價,啟用代理式模式不額外收費。
- 秒級片段定位(sub-second moment retrieval),可用於自動化影片剪輯
- 跨數小時內容的長影片搜尋
- 動態幀率取樣下的異常偵測
- 動作與物件的精確計數
影響範圍:從 API 到 YouTube 的擴散路徑
此功能已透過 API 立即開放,並將陸續推送到 Gemini App 的 Flash 與 Flash-Lite 系列模型;YouTube 的「Ask YouTube」功能也預告未來數月內導入同一套處理邏輯。技術文件放在 ai.dev/learn/agentic-video-understanding-with-gemini,列出完整的參數設定與使用範例。
原始來源:Google — Introducing agentic video understanding with Gemini
Hugging Face 發布 @huggingface/kernels:207 個 WebGPU 核心,讓瀏覽器原生跑深度學習運算
huggingface.co · 2026-09-01
Hugging Face 於 2026 年 9 月 1 日發布 @huggingface/kernels JavaScript 函式庫,讓瀏覽器可以直接從 Hugging Face Hub 載入並執行最佳化過的 WebGPU 運算核心(kernel)。首發即涵蓋 207 個核心,全部發布在 Hub 上的 webgpu-kernels 組織下,採 Apache-2.0 授權,npm 套件名稱為 @huggingface/kernels@preview。
背景:WebGPU 可攜性不等於效能
WebGPU 是跨瀏覽器的可攜式 GPU API,WGSL(WebGPU Shading Language)則是對應的共通 shader 語言。官方部落格點出關鍵問題:可攜性不代表效能——同一段 WGSL 程式碼在不同硬體上直接執行,效能落差可能很大,因此需要針對常見運算子做專門調校,而非只依賴通用實作。
核心改動:每個核心的標準化結構與載入方式
每個核心倉庫遵循固定結構:manifest.json 定義運算契約(輸入輸出與型別限制)、metadata.json 記錄核心識別與來源、test.json 放正確性測試案例、bench.json 放效能調校案例,實際運算邏輯則寫在參數化的 *.wgsl.jinja 樣板中。載入方式非常精簡:
import { getKernel } from "@huggingface/kernels";
const add = await getKernel("webgpu-kernels/ai.onnx.Add", { version: 1 });涵蓋的運算範圍包括矩陣乘法、正規化、卷積、注意力機制原語、量化運算與資料排列轉換,命名沿用 ONNX 運算子規範,例如 ai.onnx.Add、ai.onnx.MatMul、ai.onnx.LayerNormalization、ai.onnx.Softmax。
影響範圍:實測數字與社群基準工具
官方在 Apple M4 上與 ORT WebGPU 1.30.0-dev 對比,在 1,756 個測試案例中有 809 個可直接比對,幾何平均加速 2.57 倍,中位數加速 1.90 倍,其中 629 個案例勝出、176 個落後、4 個打平。
| 運算子 | 加速倍數 |
|---|---|
| Add | 3.52x |
| Softmax | 2.11x |
| LayerNormalization | 2.22x |
| MatMul | 1.14x |
部分極端案例更為誇張:雙線性 Einsum 運算加速超過 10,000 倍,逐列 CumSum 運算加速達 301 倍,顯示通用實作在特定運算型態上效率極差。社群可透過瀏覽器基準工具 Fleet(webgpu-kernels-fleet.hf.space)在自己的硬體上跑測試並回傳效能資料;使用門檻是瀏覽器需支援 WebGPU,可用 "gpu" in navigator 偵測。