Claude Opus 5.5:基准测试、定价与新变化

claude-opus-5-5

Anthropic 发布了 Claude Opus 5.5,并推出其全新 Claude 5.5 系列中的首个模型。

本次更新直指高强度工作场景:大型代码项目、长期运行的 AI 智能体、研究、数据分析以及专业知识任务。Anthropic 表示,Opus 5.5 在许多工作负载上的性能大致达到了 Claude Fable 5.1 的水平,同时运行成本比此前的 Opus 5 明显更低。

对于开发者而言,头条式的改进不仅仅是更高的基准测试分数。Claude Opus 5.5 还带来了更低的 token 成本、100 万 token 的上下文窗口、最高 128K 输出 tokens、自适应思考,以及更快的可选模式。

看看具体发生了什么变化。

Claude Opus 5.5 一览

规格 Claude Opus 5.5
发布时间 2026 年 9 月 22 日
API 模型 ID claude-opus-5-5
上下文窗口 1M tokens
最大输出 128K tokens
Batch API 最大输出 300K tokens,测试版
输入价格 $4 / 1M tokens
输出价格 $20 / 1M tokens
缓存读取 $0.20 / 1M tokens
思考 自适应,始终开启
默认工作量 中等
知识截止 2026 年 6 月
输入 文本和图像
输出 文本

Anthropic 将 Claude Opus 5.5 列为其最新的 Opus 模型,并将其定位为面向长期运行的智能体式编码与知识工作。

Claude Opus 5.5 有什么新变化?

1. 长时间、复杂编码任务的性能更强

编码是 Anthropic 在本次发布中重点瞄准的最清晰领域之一。

Opus 5.5 并非只聚焦于孤立的编码问题,而是面向可能涉及多个文件、各种工具、关键决策以及反复步骤的任务而设计。

Anthropic 表示,早期测试者使用该模型在不到三小时内审核并修复了一个20 万行代码库;而在相同示例中,Opus 5 花费超过 20 小时。Anthropic 还在 HAProxy 的 C-to-Rust 重写任务上测试了该模型:Opus 5.5 完成得更快,且据报道成本低于 Fable 5.1。

terminal-coding
因此,本次更新尤其适用于如下工作流:

  • 大型代码库迁移
  • 面向整个仓库的重构
  • 跨多个文件的调试
  • 自动化代码审查
  • 长期运行的代码智能体
  • 软件维护与测试

更大的意义并不只是“更好的编码答案”。而是 Claude 变得更适用于工程实践——在许多步骤之间保持连贯性。

Claude Opus 5.5 基准测试

Anthropic 发布了覆盖编码、业务工作流、推理、知识工作以及计算机使用的基准结果。

| 基准 | Opus 5.5 | Opus 5 | GPT-6 Astra | | --- | --- | --- | | Terminal-Bench 4.0 | 66.4% | 52.3% | 57.9% | | FrontierCode v1.1 | 54.4% | 48.0% | 53.3% | | GDPval-AA v2.1 | 1846 | 1708 | 1542 | | AutomationBench | 40.0% | 26.9% | 41.4% | | Humanity’s Last Exam | 67.7% | 63.6% | 57.2% | | Terminal-Bench-Science 0.1 | 58.7% | 29.0% | 64.6% |

这些数据也说明:单项基准成绩需要放到具体语境中理解。Opus 5.5 在 Anthropic 公布的 Terminal-Bench、FrontierCode、GDPval-AA 以及 Humanity’s Last Exam 中领先 GPT-6 Astra。但同一张表里,GPT-6 Astra 在 AutomationBench 和 Terminal-Bench-Science 的得分更高。

opus-5-5-iweaver
Anthropic 也提醒:小幅的基准差异,正变得越来越难以用来预测用户在真实工作中的体验。因此,与其追问哪个模型“整体获胜”,不如围绕某个特定工作负载进行对比,比如编码、研究、智能体自动化或文档分析。

Claude Opus 5.5 定价

定价可能是最重要的升级之一。

Claude Opus 5.5 的费用为:

  • 输入:每 100 万 tokens $4
  • 输出:每 100 万 tokens $20
  • 每 100 万 tokens 缓存写入 $5(5 分钟缓存)
  • 每 100 万 tokens 缓存读取 $0.20

相比之下,Claude Opus 5 的输入为每 100 万 tokens $5,输出为每 100 万 tokens $25。Opus 5 的缓存读取为每 100 万 tokens $0.50。

模型 输入 输出
Claude Opus 5.5 $4 / 1M $20 / 1M
Claude Opus 5 $5 / 1M $25 / 1M

因此,基础的 token 单价降低了 20%。Anthropic 表示,总成本的降幅在典型工作负载下可达约 40%,因为 Opus 5.5 往往能用更少的 tokens 完成任务。

这对那些会反复调用工具、读取大段上下文并在较长时间内运行的智能体尤其关键。

1M 上下文窗口与 128K 输出

Claude Opus 5.5 保留了近期香港 Claude 模型引入的强大上下文容量。

它支持100 万 token 的上下文窗口,并且在标准请求中最高可输出 128K tokens。Batch API 在测试版中也支持最高 30 万 tokens 的输出。

更大的上下文窗口在以下场景中会更有用:

  • 大型代码仓库
  • 研究资料集合
  • 长篇报告
  • 多份文档
  • 合同与财务材料
  • 扩展的智能体历史记录

对于文档密集型工作流,诸如 iWeaver AI Summarizer 这样的工具也能在深入分析之前,帮助将大量 PDF、文档、视频和其他来源材料整理成结构化摘要与关键要点。

Claude Opus 5.5 快速模式

如果你更在意延迟,也可以使用快速模式(Fast Mode)。

Anthropic 表示,在 Claude Code 和 Claude Platform 上,Fast Mode 最多可让 Opus 5.5 的速度达到标准速度的 2.5 倍。

代价是价格:

  • $8 / 1M 输入 tokens
  • $40 / 1M 输出 tokens

这相当于标准 API token 价格的两倍。因此,当响应时间比尽可能降低成本更重要时,Fast Mode 才最有意义。

Claude Opus 5.5 vs Opus 5:到底变了什么?

这次升级的意义远不止一个简单的版本号更新。

相较于 Opus 5,Opus 5.5 提供:

领域 变化
编码 对长期运行与多文件任务更强
智能体工作流 针对延长任务的效率更高
输入价格 $5 → $4 / 每百万 tokens
输出价格 $25 → $20 / 每百万 tokens
缓存读取 $0.50 → $0.20 / 每百万 tokens
上下文 仍为 1M tokens
最大输出 仍为 128K
思考 自适应思考始终开启

正在迁移现有 Opus 5 应用的开发者应注意:Opus 5.5 也引入了若干行为层面的变化。例如,思考不再可以关闭,部分工具使用行为也发生了调整。Anthropic 建议在直接替换生产环境中的模型 ID 之前,先查看其迁移文档。

Claude Opus 5.5 在哪里可用?

Claude Opus 5.5 可通过以下方式在 Claude Platform 上使用:claude-opus-5-5

Anthropic 也列出支持通过Amazon Bedrock、Google Cloud、Microsoft Foundry,以及 AWS 上的 Claude Platform进行访问。面向消费者的访问权限可在支持的 Claude 付费计划中使用。

在 iWeaver 上试用 Claude Opus 5.5

你还可以在无需搭建 API 的情况下,在 iWeaver 上直接试用 Claude Opus 5.5。iWeaver 提供每日免费额度,让你在决定是否符合你的需求之前,就能用真实任务来测试模型,例如文档分析、研究、写作、摘要以及其他知识类工作流。

对于只想体验 Claude Opus 5.5、但不想管理 API key、计费或开发配置的用户而言,这是一种轻松的入门方式。

Claude Opus 5.5 值得用吗?

如果你的工作包含既复杂又需要长期推进的任务,那么 Claude Opus 5.5 最值得关注。

对于简短提问或轻量生成,使用 Opus 级模型可能仍然没有必要。但在大型代码项目、文档密集型研究、业务分析、自动化智能体,以及那些犯错或需要反复重试会变得昂贵的工作流中,“更强的性能 + 更低的 token 成本”这一组合就非常关键。这次发布也改变了前沿模型之间的竞争格局:Claude Opus 5.5 现在位于 Anthropic 最高端 Fable 系列与更便宜的 Sonnet 选项之间,同时在先进编码与智能体工作负载上与例如 GPT-6 Astra 等模型正面竞争。

因此,下一次对比尤其值得:Claude Opus 5.5 vs GPT-6。