Opus 5.5:降價四成,終端任務準確率衝上66.4%
Anthropic · 2026-09-22
Opus 5.5 把每百萬 token 的輸入價格從 5 美元降到 4 美元、輸出從 25 美元降到 20 美元,同時 Terminal-Bench 4.0 的準確率從 Opus 5 的 52.3% 升到 66.4%,這兩個數字是本次更新公布的核心變化。
背景
在 Opus 5.5 之前,用 Opus 5 跑代理型(agentic)任務的團隊常遇到一個取捨:要更高的終端操作與程式碼遷移準確率,就得接受較高的 單位成本;要壓低成本,就得承受更高的失敗率與重試次數。官方公布的資料顯示,Opus 5 在 AutomationBench 上只有 26.9%,CursorBench 4.0 為 46.6%,代表不少自動化任務需要人工介入或重跑,直接反映在帳單與人力成本上。
核心改動
Opus 5.5 公布的價格與評測數字如下表,出自官方發布頁與 system card。輸出速度比 Opus 5 快 30%,一個 680,000 行的程式碼遷移任務可在一天內完成;web app 最佳化測試中 40 次嘗試成功 39 次;HAProxy 從 C 移植到 Rust 耗時 9.5 小時,比 Fable 5.1 的 12 小時快,成本低 51%。
| 項目 | Opus 5 | Opus 5.5 |
|---|---|---|
| 輸入(每百萬 token) | $5 | $4 |
| 輸出(每百萬 token) | $25 | $20 |
| 快取讀取 | $0.50 | $0.20 |
| 快取寫入 | $6.25 | $5 |
| Terminal-Bench 4.0 | 52.3% | 66.4% |
| CursorBench 4.0 | 46.6% | 57.8% |
| AutomationBench | 26.9% | 40.0% |
| Terminal-Bench-Science 0.1 | 29.0% | 58.7% |
| OSWorld 2.0(partial) | 74.0% | 81.8% |
| GDPval-AA v2.1 | 1708 Elo | 1846 Elo |
模型代號同步更新為 claude-opus-5-5,可透過 Claude Platform、AWS、Google Cloud、Microsoft Azure 呼叫,沿用既有 API 呼叫方式,只需替換模型字串:
model = "claude-opus-5-5"安全性方面,官方指出 邊界規避(boundary circumvention)行為比 Opus 5 少 85%,提示注入(prompt injection)防禦能力在各項測試中不遜於或優於 Opus 5。至於 context window 大小,官方發布頁與 system card 均未列出具體數字,屬於官方未公布項目。
影響範圍
用 Opus 5 跑批次任務、對成本敏感的團隊,可檢查帳單結構:輸入、輸出、快取讀寫價格全面調降,官方稱整體成本比 Opus 5 低 40%。原本因準確率不足而繞開 Opus 5、改用其他模型跑終端自動化或程式碼遷移的團隊,也值得重新評估 model routing,因為 Terminal-Bench-Science 0.1 從 29.0% 跳到 58.7%,OSWorld 2.0 從 74.0% 升到 81.8%,過去會失敗或需人工修正的案例比例可能已下降。
需要更長 context 或更強代理能力的應用,因官方未公布 context window 數字,建議先重跑既有 eval 集合再決定是否切換模型,而非直接假設容量提升。已串接 Fable 5.1 的團隊,可參考表中對照數字,決定是否針對終端操作、程式碼搬遷等任務改用 Opus 5.5。