Claude Sonnet 5.5 是 Anthropic 面向日常专业工作的效率型模型。它于 2026 年 9 月 28 日发布。对于最难的开放式问题,它在定位上位于 Opus 5.5 之下,但在编码、文档创建、图像理解以及需要长时间推进的任务中带来了切实的提升。最实用的变化也很直接:Anthropic 表示它的输出速度比 Sonnet 5 快超过 30%,保持相同的 API 计费令牌价格,而且由于通常会使用更少的令牌,它在“完成任务”维度上每次任务的成本最高还能降低 30%。
它面向那些希望使用一款能力强、适用于明确工作内容的模型的人,而无需在每次请求中都为 Opus 付费。选择模型很少仅仅取决于最高的基准测试分数;延迟、重试次数、令牌用量以及人工复核,往往会对工作流的实际成本产生更大的影响。
Claude Sonnet 5.5 概览
| 细节 | Claude Sonnet 5.5 |
|---|---|
| 发布时间 | 2026 年 9 月 28 日 |
| API 模型名称 | claude-sonnet-5-5 |
| 标准输入价格 | 每 1M 令牌 $2 |
| 标准输出价格 | 每 1M 令牌 $10 |
| 缓存读取价格 | 每 1M 令牌 $0.20 |
| 缓存写入价格 | 每 1M 令牌 $2.50 |
| 最佳适用 | 结构清晰的编码与专业任务 |
| 可用性 | Claude 产品、Claude Platform、AWS、Google Cloud 以及 Microsoft Azure |
以上数据来自 Anthropic 的 Sonnet 5.5 公告。云服务提供商的定价与访问条件可能不同,因此团队在估算生产成本前,应先确认自己实际使用的平台。
从 Sonnet 5 到底变了什么?
这次更新最强的地方在于:当模型需要“做事”而不只是回答问题时。Anthropic 强调的包括修复漏洞、文档更精致、制作演示稿、电子表格、视觉设计,以及更长周期的任务。Sonnet 5.5 还支持可调节的“努力程度”:较低设置更重视速度与更低的令牌用量,而较高设置则允许更多推理与检查。Anthropic 在 Claude Code 及其应用中将 Medium 设为默认选项,而 Claude Platform 则默认 High。
关于速度与成本的主打宣传需要更严谨地理解。“30%+ 更快”指的是与 Sonnet 5 相比的输出生成速度。“最多降低 30%”指的是 Anthropic 观察到的按任务计费成本,而不是每个令牌的折扣。列出的 API 价格仍为:输入每百万令牌 $2,输出每百万令牌 $10。因此,实际节省取决于新模型是否能用更短的回答、更少的重试或更少的工具调用来完成你的工作。

Anthropic 发布了多项覆盖“代理式编码”和知识工作(knowledge work)的评估结果。它们显示在部分环境中相较 Sonnet 5 有显著提升,而在另一些场景中接近 Opus 的表现。
| 基准 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | 未公布 |
| FrontierCode 1.1 Main | 46.2%(最大值) | 42.4% | 54.4% | 49.3%;52.1%(Xhigh) |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | 未公布 |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483 |
这张表很有参考价值,但它并不是通用的“排行榜”。努力程度设置、代理执行框架(agent harness)、工具、保护机制(safeguards)以及评分方法都会有所不同。Anthropic 也提到:更多推理并不总能带来更好的结果——在 FrontierCode 中,当 Sonnet 5.5 处于最大值时,有时会产生超出所请求范围的改动。最佳配置是在“可控编辑”的前提下得到令人满意的结果,而不一定是消耗计算量最多的那一种。
编码与代理式工作
Sonnet 5.5 在 Terminal-Bench 4.0 上取得的 70.6% 是发布内容中最引人注目的数字,但围绕它的工作流比标题式的成绩更重要。对开发者而言,一个有用的编码模型必须能理解代码库、进行有针对性的修改、运行合适的检查,并在扩大任务范围之前就停下来。只有当输出仍然容易审阅时,速度才真正有价值。
因此,Sonnet 5.5 很适合作为“有边界的工作”的候选,例如诊断一个漏洞、实现一个明确指定的功能、审阅一次拉取请求,或对已知组件进行重构。大型迁移以及模糊的架构决策,可能仍会从 Opus 5.5 中受益——而 Anthropic 也明确表示 Opus 5.5 更适合持续性的判断(sustained judgment)。因此,公平的评估应该基于真实代码库任务,并衡量正确性、不必要的修改、耗时、总令牌数以及人工复核时间。
文档、电子表格与知识工作
这次发布对软件开发之外的场景同样相关。Anthropic 将 Sonnet 5.5 描述为在创建文档、幻灯片和电子表格方面表现强劲;而 GDPval-AA 与 AA-Briefcase 的结果则旨在反映专业知识工作。这些分数并不能证明每一份报告都会准确,但它们支持用结构化任务对模型进行测试:要求有清晰的来源材料,并且产出物可被验证。
一个实用的工作流可能从多份报告、会议纪要和一份电子表格开始,然后让模型识别一致之处与矛盾点,提取带来源引用的关键数据,并起草一份高管简报。最重要的保障是验证:所有数值主张都应与来源进行核对,且具有影响性的结论仍需要经过有资质的人工复核。如果第一步的挑战是整理混合来源材料,iWeaver 的 AI总结器 可以帮助把 PDF、文档、网页、音频、图片和视频先转换为摘要或结构化笔记,再进行更深入的分析。
放在上下文里的定价
Sonnet 5.5 与 GPT-6 Sol 共享相同的标准公开单价:输入每百万令牌 $2,输出每百万令牌 $10。Opus 5.5 分别为 $4 和 $20。这样的定价使 Sonnet 特别适合反复执行、且定义清晰的任务,但“按令牌速率”的比较并不完整。上下文长度(context size)、缓存机制(caching)、工具调用费用、推理投入、失败的运行次数以及输出长度,都会影响最终账单。
在生产环境评估中,应选择一组有代表性的任务,并记录“总任务成本”,而不是只看每个令牌的价格。某个更便宜的模型如果需要反复修正,可能会比预期花更多;而某个更贵的模型在一次通过就完成高价值任务时,反而可能更划算。由于服务方的行为与部署配置可能会变化,同一套测试集也应在模型更新后重新跑一遍。
Claude Sonnet 5.5 值得用吗?
如果你的大部分工作范围都非常清晰,并且你看重响应速度、可预期的 API 定价,以及强劲的编码或文档能力,那么 Sonnet 5.5 值得进行测试。当问题模糊不清、细微错误的成本很高,或任务需要在许多阶段持续做出判断时,它就不那么“显而易见”地适合作为默认选择;这些情况更接近 Opus 5.5 其所宣称的定位。
最有力的结论并不是“Sonnet 5.5 击败了所有替代方案”。而是:Anthropic 在保留明显价格差异的同时,显著缩小了其日常档与高端档之间的差距。用这些基准测试来决定哪些值得试用,然后结合你自己的来源、提示词、复核标准与总任务成本来选择。若需要直接做“档位”决策,请查看 Claude Sonnet 5.5和Opus 5.5对比。如果你想了解如何搭建思路,请继续阅读 免费使用Claude Sonnet 5.5。
