Sonnet 5.5 上線:官方稱同代最快、最省
Anthropic · 2026-09-28
Claude Sonnet 5.5 把同代模型的速度與價格門檻一起往下砍了一截:官方數據顯示,新模型比前代 Sonnet 5 快 30% 以上,多數工作的成本也能省下最多 30%,而在多項 agentic、推理基準上的分數更出現數倍到十倍以上的躍升。Anthropic 於 2026 年 9 月 28 日發布 Sonnet 5.5,模型代號 claude-sonnet-5-5,已同步上架 AWS、Google Cloud 與 Microsoft Azure。
背景
Sonnet 5 在需要長時間操作終端機、瀏覽器或作業系統的 agentic 任務上,表現一直是明顯的短板。以官方公布的 Terminal-Bench 4.0 為例,Sonnet 5 只拿到 10.3%,OSWorld 2.1(partial)也僅 57.0%;換句話說,凡是需要模型自己跑指令、操作視窗、串接多步工具的場景,過去大多得升級到 Opus 才跑得動,但 Opus 的輸入/輸出單價是 Sonnet 的兩倍。這讓不少團隊在「用 Sonnet 省錢」與「用 Opus 才能把 agent 任務跑完」之間反覆權衡,等於是繞了一圈才能拿到堪用的結果。
更棘手的是,這個落差不只出現在「要不要用工具」的場景。官方公布的 Chartography 分數是在完全不給工具的條件下測的,Sonnet 5 只拿 15.6%,代表問題不只是「不會呼叫工具」,模型本身在圖表、資料判讀這類推理任務上的底子也不夠扎實。同樣地,Humanity's Last Exam 在「含工具」條件下 Sonnet 5 也僅 54.9%,顯示即使把工具遞到手上,模型整合資訊、規劃步驟的能力仍是瓶頸,而不是單純缺少呼叫介面。
核心改動
Sonnet 5.5 的改動集中在把 agentic 與工具使用能力補齊,而不只是小幅刷分。官方公布的基準對照如下(均為 Sonnet 5 → Sonnet 5.5):
| 基準測試 | Sonnet 5 | Sonnet 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 10.3% | 70.6% |
| OSWorld 2.1(partial) | 57.0% | 80.1% |
| Chartography(無工具) | 15.6% | 61.6% |
| CursorBench 4.0 | 34.1% | 55.5% |
| FrontierCode 1.1(Main) | 42.4% | 46.2% |
| Humanity's Last Exam(含工具) | 54.9% | 64.5% |
| GDPval-AA v2.1 | 1449 | 1844 |
| AA-Briefcase v1.1 | 1359 | 1811 |
官方也點出 Sonnet 5.5 與同期旗艦 Opus 5.5 的距離:Sonnet 5.5 在 GDPval-AA 上只落後 Opus 5.5 兩分。定價則維持階梯式落差:
| 項目(每 1M tokens) | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 輸入 | $2 | $4 |
| 輸出 | $10 | $20 |
| 快取讀取 | $0.20 | $0.20 |
| 快取寫入 | $2.50 | $5 |
官方頁面沒有公布 context window 大小,也沒有列出 Sonnet 5 本身的舊定價,這兩點目前只能標記為官方頁面未公布,不做推測。值得注意的是,即使在完全不給工具的 Chartography 測試裡,Sonnet 5.5 的分數也從 15.6% 跳到 61.6%,漲幅比多數「含工具」的基準還大,說明這次升級不是單純把 agent 迴圈調順而已,模型本身處理長流程、多步推理的基礎能力也一併墊高了。
影響範圍
受影響最直接的是用成本門檻做模型路由的團隊:過去因為 Sonnet 5 的 agentic 分數太低而把終端機、瀏覽器操作類任務導去 Opus 的邏輯,現在多了一個折衷選項可以重新測。跑 CI 內 agentic coding、需要模型自己開終端機跑測試或修 bug 的 pipeline,也值得針對 claude-sonnet-5-5 重新量測一次 Terminal-Bench 類型任務的成功率,而不是沿用 Sonnet 5 時代的保守假設。
另外,Anthropic 同步釋出了遷移指南與 preserved thinking 文件,涉及把既有整合從 Sonnet 5 切到 5.5 的團隊,應該先看這兩份文件確認 thinking 開關與快取行為是否需要調整,而不是直接把模型字串換掉就上線。遷移指南裡特別列了一節講怎麼把 thinking 關掉,代表 5.5 的 thinking 行為與 Sonnet 5 不完全相同,用固定 prompt 模板跑批次任務的團隊,應該先跑一輪迴歸測試,確認輸出格式與延遲沒有跟著跳動。
採購或平台團隊則要留意雲端供應商的同步時間:Sonnet 5.5 在發布當下就已經同步上架 AWS、Google Cloud 與 Microsoft Azure 三個平台,用 Bedrock、Vertex AI 或 Azure AI Foundry 呼叫 Claude 的既有帳號,理論上不需要另外申請存取權限,但仍值得先在測試環境用 claude-sonnet-5-5 這個模型代號跑一次基本呼叫,確認計費項目(輸入、輸出、快取讀取、快取寫入)都對得上上面列出的價格表,再切到正式流量。