AI 前沿 2026 年 9 月 29 日

2026-09-29 — Sonnet 5.5 上線:官方稱同代最快、最省

primary=https://www.anthropic.com/claude-sonnet-5-5

Sonnet 5.5 上線:官方稱同代最快、最省

Anthropic · 2026-09-28

Claude Sonnet 5.5 把同代模型的速度與價格門檻一起往下砍了一截:官方數據顯示,新模型比前代 Sonnet 5 快 30% 以上,多數工作的成本也能省下最多 30%,而在多項 agentic、推理基準上的分數更出現數倍到十倍以上的躍升。Anthropic 於 2026 年 9 月 28 日發布 Sonnet 5.5,模型代號 claude-sonnet-5-5,已同步上架 AWS、Google Cloud 與 Microsoft Azure。

背景

Sonnet 5 在需要長時間操作終端機、瀏覽器或作業系統的 agentic 任務上,表現一直是明顯的短板。以官方公布的 Terminal-Bench 4.0 為例,Sonnet 5 只拿到 10.3%,OSWorld 2.1(partial)也僅 57.0%;換句話說,凡是需要模型自己跑指令、操作視窗、串接多步工具的場景,過去大多得升級到 Opus 才跑得動,但 Opus 的輸入/輸出單價是 Sonnet 的兩倍。這讓不少團隊在「用 Sonnet 省錢」與「用 Opus 才能把 agent 任務跑完」之間反覆權衡,等於是繞了一圈才能拿到堪用的結果。

更棘手的是,這個落差不只出現在「要不要用工具」的場景。官方公布的 Chartography 分數是在完全不給工具的條件下測的,Sonnet 5 只拿 15.6%,代表問題不只是「不會呼叫工具」,模型本身在圖表、資料判讀這類推理任務上的底子也不夠扎實。同樣地,Humanity's Last Exam 在「含工具」條件下 Sonnet 5 也僅 54.9%,顯示即使把工具遞到手上,模型整合資訊、規劃步驟的能力仍是瓶頸,而不是單純缺少呼叫介面。

核心改動

Sonnet 5.5 的改動集中在把 agentic 與工具使用能力補齊,而不只是小幅刷分。官方公布的基準對照如下(均為 Sonnet 5 → Sonnet 5.5):

基準測試Sonnet 5Sonnet 5.5
Terminal-Bench 4.010.3%70.6%
OSWorld 2.1(partial)57.0%80.1%
Chartography(無工具)15.6%61.6%
CursorBench 4.034.1%55.5%
FrontierCode 1.1(Main)42.4%46.2%
Humanity's Last Exam(含工具)54.9%64.5%
GDPval-AA v2.114491844
AA-Briefcase v1.113591811

官方也點出 Sonnet 5.5 與同期旗艦 Opus 5.5 的距離:Sonnet 5.5 在 GDPval-AA 上只落後 Opus 5.5 兩分。定價則維持階梯式落差:

項目(每 1M tokens)Sonnet 5.5Opus 5.5
輸入$2$4
輸出$10$20
快取讀取$0.20$0.20
快取寫入$2.50$5

官方頁面沒有公布 context window 大小,也沒有列出 Sonnet 5 本身的舊定價,這兩點目前只能標記為官方頁面未公布,不做推測。值得注意的是,即使在完全不給工具的 Chartography 測試裡,Sonnet 5.5 的分數也從 15.6% 跳到 61.6%,漲幅比多數「含工具」的基準還大,說明這次升級不是單純把 agent 迴圈調順而已,模型本身處理長流程、多步推理的基礎能力也一併墊高了。

影響範圍

受影響最直接的是用成本門檻做模型路由的團隊:過去因為 Sonnet 5 的 agentic 分數太低而把終端機、瀏覽器操作類任務導去 Opus 的邏輯,現在多了一個折衷選項可以重新測。跑 CI 內 agentic coding、需要模型自己開終端機跑測試或修 bug 的 pipeline,也值得針對 claude-sonnet-5-5 重新量測一次 Terminal-Bench 類型任務的成功率,而不是沿用 Sonnet 5 時代的保守假設。

另外,Anthropic 同步釋出了遷移指南與 preserved thinking 文件,涉及把既有整合從 Sonnet 5 切到 5.5 的團隊,應該先看這兩份文件確認 thinking 開關與快取行為是否需要調整,而不是直接把模型字串換掉就上線。遷移指南裡特別列了一節講怎麼把 thinking 關掉,代表 5.5 的 thinking 行為與 Sonnet 5 不完全相同,用固定 prompt 模板跑批次任務的團隊,應該先跑一輪迴歸測試,確認輸出格式與延遲沒有跟著跳動。

採購或平台團隊則要留意雲端供應商的同步時間:Sonnet 5.5 在發布當下就已經同步上架 AWS、Google Cloud 與 Microsoft Azure 三個平台,用 Bedrock、Vertex AI 或 Azure AI Foundry 呼叫 Claude 的既有帳號,理論上不需要另外申請存取權限,但仍值得先在測試環境用 claude-sonnet-5-5 這個模型代號跑一次基本呼叫,確認計費項目(輸入、輸出、快取讀取、快取寫入)都對得上上面列出的價格表,再切到正式流量。

原始來源:Introducing Claude Sonnet 5.5


End of article
0
Would love your thoughts, please comment.x
()
x