AI 前沿 2026 年 9 月 2 日

2026-09-02 — Anthropic 雙模型安全分流、Gemini 代理式影片理解、Hugging Face 207 個 WebGPU 核心

primary=https://www.anthropic.com/claude-fable-and-mythos-5-1 primary=https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/ primary=https://huggingface.co/blog/webgpu-kernels

Anthropic 發表 Claude Fable 5.1 與 Mythos 5.1:同一顆模型、雙重安全閥門的命名分流

anthropic.com · 2026-09-01

Anthropic 於 2026 年 9 月 1 日發表 Claude Fable 5.1Claude Mythos 5.1,官方說明兩者「是同一個模型,只是安全防護層級不同」。API 模型代號統一為 claude-fable-5-1,已同步上架 Claude.ai、Claude API 以及 AWS、Google Cloud、Microsoft Azure 三大雲端平台。這次更新的重點落在代理式(agentic)長情境作業、程式除錯與科學研究能力。

核心改動:跑分全面對比 Fable 5 與 Opus 5

官方公布的內部評測顯示,新版在多項代理式與推理基準上都超越前代與同代旗艦模型。以下數字皆為 Anthropic 自行測得:

BenchmarkFable 5.1Fable 5Opus 5
Terminal-Bench-Science 0.152.6%24.7%29.0%
Terminal-Bench 4.055.8%42.0%52.3%
Humanity's Last Exam(無工具)60.9%57.8%56.6%
OSWorld 2.0(partial)77.9%72.9%75.4%
CursorBench 3.2.073.4%70.5%70.0%
AutomationBench31.4%17.1%26.9%

其中 Terminal-Bench-Science 0.1 的進步幅度最大,從 Fable 5 的 24.7% 跳到 52.6%,反映官方強調的「科學研究能力」提升方向。AutomationBench 分數也接近翻倍,對應長情境代理任務的處理能力。

規格細節:定價與安全分流機制

計費維持每百萬輸入 token US$10、輸出 US$50,但 快取讀取價格從舊制下砍 75%,降到每百萬 token US$0.25。官方換算典型工作負載成本較 Fable 5 降低約 25%,若是高度代理式的工作流程,成本降幅最高可達 45%。

Fable 與 Mythos 的分流本質是安全防護等級的不同開關:一般管道走 Fable 5.1,較低防護版本的 Mythos 5.1 則搭配 Cyber Verification Program(網路安全驗證計畫)與 Life Sciences Verification Program(生命科學驗證計畫),供防禦性資安研究與生醫研究人員申請使用,例如允許漏洞探勘(vulnerability discovery,非漏洞利用開發)等原本受限的操作。Anthropic 表示資安防護的誤判率(false positive)較先前下降 60%。

影響範圍:企業資料控管與科學實測案例

企業客戶另可申請 Enterprise Frontier Safeguards(EFS),將資料儲存權限交還客戶自行控管,預計 2026 年秋季陸續開放。產品線涵蓋 Claude Code、Claude Enterprise、Claude Platform,以及三大雲端的代理平台版本(Amazon Bedrock、Google Agent Platform、Microsoft Foundry)。

官方也附上幾項科學應用實測數字:蛋白質結合體(protein binder)設計在 12 個目標上的命中率接近 50%,相較業界典型的 10–15% 明顯提升;金星地形高程建模解析度從 10–20 公里提升到 2–3 公里;部分深度學習模型的運算最佳化可帶來最高 2.5 倍 GPU 加速。

原始來源:Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1


Google 為 Gemini 導入代理式影片理解:不再固定幀率抽樣,改由模型自主決定看哪一段

blog.google · 2026-09-01

Google 於 2026 年 9 月 1 日在 Gemini 3.7 FlashGemini 3.6 FlashGemini 3.5 Flash-Lite 三個模型上發表代理式影片理解(agentic video understanding)功能。開發者只需在 API 呼叫中加入 "processing": "agentic" 參數即可啟用,透過 Google AI Studio 與 Gemini Enterprise Agent Platform 立即可用。此功能鎖定長影片內容的搜尋與分析場景。

核心改動:模型自主決定取樣方式

傳統影片理解以固定幀率逐格處理,代理式模式則讓模型動態搜尋、掃描並檢視特定影片片段,同時跨視覺畫面、音訊與逐字稿三種模態運作。官方描述模型會依查詢內容自行判斷要分析哪一段、用什麼播放速度、透過哪一種模態切入,而非無差別地處理整段影片。

這個機制對長篇內容(10 分鐘到數小時的錄影)效益最明顯,因為固定幀率抽樣在長影片上會浪費大量 token 在不相關畫面。

規格細節:token 與準確率的實測落差

官方公布與固定幀率處理相比的效能數字:token 消耗最高減少 88%,成本最高降低 66%,準確率最高提升 7%。計費本身沿用既有 Gemini API 標準 token 定價,啟用代理式模式不額外收費。

  • 秒級片段定位(sub-second moment retrieval),可用於自動化影片剪輯
  • 跨數小時內容的長影片搜尋
  • 動態幀率取樣下的異常偵測
  • 動作與物件的精確計數

影響範圍:從 API 到 YouTube 的擴散路徑

此功能已透過 API 立即開放,並將陸續推送到 Gemini App 的 Flash 與 Flash-Lite 系列模型;YouTube 的「Ask YouTube」功能也預告未來數月內導入同一套處理邏輯。技術文件放在 ai.dev/learn/agentic-video-understanding-with-gemini,列出完整的參數設定與使用範例。

原始來源:Google — Introducing agentic video understanding with Gemini


Hugging Face 發布 @huggingface/kernels:207 個 WebGPU 核心,讓瀏覽器原生跑深度學習運算

huggingface.co · 2026-09-01

Hugging Face 於 2026 年 9 月 1 日發布 @huggingface/kernels JavaScript 函式庫,讓瀏覽器可以直接從 Hugging Face Hub 載入並執行最佳化過的 WebGPU 運算核心(kernel)。首發即涵蓋 207 個核心,全部發布在 Hub 上的 webgpu-kernels 組織下,採 Apache-2.0 授權,npm 套件名稱為 @huggingface/kernels@preview

背景:WebGPU 可攜性不等於效能

WebGPU 是跨瀏覽器的可攜式 GPU API,WGSL(WebGPU Shading Language)則是對應的共通 shader 語言。官方部落格點出關鍵問題:可攜性不代表效能——同一段 WGSL 程式碼在不同硬體上直接執行,效能落差可能很大,因此需要針對常見運算子做專門調校,而非只依賴通用實作。

核心改動:每個核心的標準化結構與載入方式

每個核心倉庫遵循固定結構:manifest.json 定義運算契約(輸入輸出與型別限制)、metadata.json 記錄核心識別與來源、test.json 放正確性測試案例、bench.json 放效能調校案例,實際運算邏輯則寫在參數化的 *.wgsl.jinja 樣板中。載入方式非常精簡:

import { getKernel } from "@huggingface/kernels";
const add = await getKernel("webgpu-kernels/ai.onnx.Add", { version: 1 });

涵蓋的運算範圍包括矩陣乘法、正規化、卷積、注意力機制原語、量化運算與資料排列轉換,命名沿用 ONNX 運算子規範,例如 ai.onnx.Addai.onnx.MatMulai.onnx.LayerNormalizationai.onnx.Softmax

影響範圍:實測數字與社群基準工具

官方在 Apple M4 上與 ORT WebGPU 1.30.0-dev 對比,在 1,756 個測試案例中有 809 個可直接比對,幾何平均加速 2.57 倍,中位數加速 1.90 倍,其中 629 個案例勝出、176 個落後、4 個打平。

運算子加速倍數
Add3.52x
Softmax2.11x
LayerNormalization2.22x
MatMul1.14x

部分極端案例更為誇張:雙線性 Einsum 運算加速超過 10,000 倍,逐列 CumSum 運算加速達 301 倍,顯示通用實作在特定運算型態上效率極差。社群可透過瀏覽器基準工具 Fleet(webgpu-kernels-fleet.hf.space)在自己的硬體上跑測試並回傳效能資料;使用門檻是瀏覽器需支援 WebGPU,可用 "gpu" in navigator 偵測。

原始來源:Hugging Face — Introducing @huggingface/kernels


End of article
0
Would love your thoughts, please comment.x
()
x