close
人工智能

Claude Sonnet 5.5 懶人包:編程跑分大增、速度快 30%,API 不減價節省三成成本


太空中的地球與Claude Sonnet 5.5標誌.

Anthropic 正式推出主力模型 Claude Sonnet 5.5,延續兼顧效能、速度與成本的定位,重點升級編程與 Agent 工作流。新模型生成速度提高超過 30%,API 單價保持不變,但受惠於 Token 與工具調用步驟減少,部分任務的實際運算成本降低達 30%。以下是懶人包:

規格與定價定位

官方將 Sonnet 5.5 定位為高階模型 Opus 5.5 的高速、低成本補充方案。Opus 5.5 主要針對需要長時間判斷及複雜推理的工作,Sonnet 5.5 則聚焦需求明確的日常開發,包括修復錯誤、修改現有程式碼庫與驅動編程代理。

項目 Claude Sonnet 5.5 規格詳情
API Model ID claude-sonnet-5-5
Context Window 1M Tokens
最大輸出容量 128K Tokens
Input API 價格 US$2 / 1M Tokens
Output API 價格 US$10 / 1M Tokens
快取讀取 (Cache Read) US$0.20 / 1M Tokens
5 分鐘快取寫入 (Cache Write) US$2.50 / 1M Tokens
推理檔次 (Effort) Low / Medium / High / XHigh / Max
預設 Effort Claude API:High / Claude Code:Medium
思考機制 Adaptive Thinking
支援平台 Claude API、AWS、Google Cloud、Microsoft Azure

新模型維持 100 萬 Token 的上下文視窗與 128K 最大輸出容量。今次升級並非依賴擴大視窗容量,主要集中在程式碼生成、工具調用效率與整體運算速度。

編程能力與實測跑分

在自主編程代理測試中,Sonnet 5.5 成績明顯提升。在終端操作基準測試 Terminal-Bench 4.0 中,得分由前代的 10.3% 提升至 70.6%,高於 Opus 5.5 的 66.4%。

在模擬真實多檔案開發任務的 CursorBench 4.0 中,新模型得分由 34.1% 提升至 55.5%,與 Opus 5.5 僅差約 2 個百分點。

測試基準 (Benchmark) Sonnet 5 Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0 10.3% 70.6% 66.4%
CursorBench 4.0 34.1% 55.5% 57.8%
FrontierCode 1.1 基準線 較 Sonnet 5 高約 10 個百分點(成本約 1/15) —

FrontierCode 1.1 的增幅雖不及前兩項測試顯著,但更能反映成本差距。Sonnet 5.5 在 High Effort 模式下的得分較 Sonnet 5 高約 10 個百分點,但完成每項工作的成本僅約為後者的 1/15。

這亦反映 Sonnet 5.5 在工具調用方面的改善。模型在理解程式碼庫後,較常一次批次執行多個工具調用,減少反覆搜尋與重試的循環。Lovable 內部評測顯示,Sonnet 5.5 的 Tool Call 減少約 1/3,Shell 執行次數亦減少接近 1/2,有助於縮減等待時間與調用開銷。

Claude Sonnet 5.5與其他處理器性能對比圖表.

任務總成本大幅降低

Sonnet 5.5 的 API 單價維持在輸入每百萬 Token 2 美元、輸出 10 美元。官方所稱的成本降幅來自輸出速度加快超過 30%,以及完成相同工作所需的代幣總量縮減,而非標價下調。

指標項目 Sonnet 5.5 實際變化
Token 單價 (Input / Output) 維持不變
輸出速度 提升超過 30%
工具調用次數 部分實測減少約 1/3
Shell 執行次數 部分實測減少近 1/2
實際任務成本 (Cost per Task) 部分工作最高降低約 30%

傳統單次對話的成本由單價直接決定,但編程代理的工作涉及連續檢索檔案、終端除錯與多輪修正。執行步驟減少帶來的是整體任務成本的改善,而非只是代幣單價差異。

Anthropic 測試指出,Sonnet 5.5 在部分 Benchmark 使用 Low 或 Medium Effort 時,已能超越 Sonnet 5 的最高成績,每項工作的成本最低可降至原本的 1/10。

重新調校五級推理設定

系統提供 5 級 Effort 設定供開發者調整運算資源。目前 Claude API 預設為 High,而 Claude Code 與 Claude Apps 則預設為 Medium。

應用情境 建議 Effort 起點
一般對話與低延遲需求 Low / Medium
日常代碼編寫 Medium
編程代理與多步工具調用 Medium
複雜架構設計與除錯 High
較困難的長時間任務 XHigh / Max

同名 Effort 並不代表模型會使用相同程度的推理量。Anthropic 指 Sonnet 5.5 已重新校準各級 Effort,因此開發者由 Sonnet 5 遷移後不應直接沿用舊設定,建議重新測試工作流程的速度、準確率與成本。需求明確的代理任務建議由 Medium 起步,遇上較困難或需要長時間處理的工作,再考慮升至 High。

不同AI模型在不同成本和效能水平的表現比較圖.

升級注意事項與遷移方案

現有生產環境部署需留意數項 API 變更。若未依新規範修改參數,將直接引發調用錯誤。

原有設定 (Sonnet 5) 新版變更 (Sonnet 5.5) 建議應對方式
tool_choice: tool 或 any 不再支援(返回 400 錯誤) 改用 tool_choice: auto,搭配 strict: true 並於提示詞說明
thinking: disabled 不再支援;Adaptive Thinking 預設開啟 如不希望模型在回答前進行完整 Thinking,可改用 thinking: between_tools
直接讀取 response.content[0].text 回傳內容可能先包含思考區塊 依 Content Block 的 type 屬性動態解析(如 text、thinking、tool_use)
自訂 temperature / top_p / top_k 不再支援非預設值 移除自訂參數,沿用預設值

回傳資料結構亦有所調整,文字內容前方可能包含思考區塊,過去直接讀取字串索引的程式碼需要重構。在 Agent Tool Loop 中,開發者亦必須將思考區塊原樣傳回模型。

為簡化升級流程,官方已將 API 遷移功能整合至 Claude Code。用戶可於專案目錄直接執行 `/claude-api migrate this project to claude-sonnet-5-5`,由工具掃描專案並處理 Model ID、Breaking Parameters、Prefill 及 Effort 等設定,再列出需要人工確認的項目。

不同模型在不同努力水平下的代理編碼得分.

Tags : AI 編程AnthropicAPIClaudeSonnet 5.5