主题
Claude Opus 5.5 调研分析
Anthropic 于当地时间 2026 年 9 月 22 日发布 Claude Opus 5.5(模型 ID:claude-opus-5-5),这是 Claude 5.5 家族的首款旗舰模型。官方定位是:在多数任务上达到上一代最强模型 Claude Fable 5.1 的水平,同时典型任务成本较 Opus 5 降低约 40%。本文基于官方发布信息与第三方报道,从规格、定价、基准表现、行为变化与选型建议几个维度做一次梳理。
基本规格
| 项目 | 规格 |
|---|---|
| 模型 ID | claude-opus-5-5 |
| 上下文窗口 | 1M tokens |
| 最大输出 | 128K tokens |
| 知识截止 | 2026 年 6 月 |
| 发布渠道 | Claude App / Claude Code(Pro、Max、Team 默认模型)、API、AWS、Google Cloud、Microsoft Azure |
与 Opus 5 相比,上下文、最大输出、知识截止均未变化,变化集中在性能、价格与行为策略上。
定价
标准模式
| 项目 | Opus 5.5 | Opus 5 | 变化 |
|---|---|---|---|
| 输入 | $4 / 百万 tokens | $5 / 百万 tokens | -20% |
| 输出 | $20 / 百万 tokens | $25 / 百万 tokens | -20% |
| 缓存读取 | $0.20 / 百万 tokens | $0.50 / 百万 tokens | -60% |
值得注意的是缓存读取单价的系数变化:Opus 5.5 的缓存读为基础输入价的 0.05 倍(其他模型为 0.1 倍)。因此「官方称典型任务成本降 40%」这个数字,在大量命中 Prompt Cache 的 Agent 场景下更容易达成;单价本身只降了 20%。
快速模式(Fast Mode)
通过 Claude Code 与 Claude Platform 提供,速度最高可达普通模式的 2.5 倍,价格为输入 $8、输出 $40(每百万 tokens),约为普通模式的 2 倍。适合交互式编码这类对延迟敏感、单任务 token 量不大的场景。
基准表现
官方发布页对比了 Opus 5.5、Fable 5.1、GPT-6 Astra、GPT-5.6 Sol 四个模型,9 项测试中 7 项领先:
| 基准 | Opus 5.5 | 说明 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 命令行编码,三项编程测试均最高 |
| FrontierCode v1.1 | 54.4% | 仅比 GPT-6 Astra 高 1.1 个点 |
| CursorBench 4.0 | 57.8% | 比 Fable 5.1 高 6 个点 |
| Terminal-Bench-Science 0.1 | 58.7% | 较 Opus 5 的 29% 翻倍,但落后 GPT-6 Astra |
| AutomationBench | 40% | 任务完成率较 Opus 5(26.9%)提升,仍落后 GPT-6 Astra |
| Humanity's Last Exam | 67.7% | — |
| GDPval-AA v2.1 | 1846(Elo) | 高于 Fable 5.1(1735)与 Opus 5(1708) |
第三方机构 Artificial Analysis 的 Intelligence 榜单上,Opus 5.5 以 58 分位列第一(Fable 5.1 与 GPT-6 Astra 均为 53 分)。
需要打折扣看的地方
这批基准均为 Anthropic 自行挑选,发布页没有 SWE-bench、GPQA、ARC-AGI 等常用横向榜单,「全面超越」的说法只在所选基准上成立。此外在 OSWorld(操作电脑)、Chartography(读图表)两项上,Opus 5.5 对 Fable 5.1 仅领先 1.1 和 0.6 个点,基本是打平——「对标 Fable 5.1」更准确的读法是「多数任务持平、编码类任务反超」,而非全面替代。
行为与 API 变化
从 Opus 5 迁移时,以下变化需要留意:
- EFFORT(思考强度)默认档位从 HIGH 降到 MEDIUM:同一档位下 Opus 5.5 的思考量比 Opus 5 更大,但默认档降低后,简单任务的成本和延迟会更友好。大重构、疑难 bug 等硬任务建议手动调高到 xhigh / max。
- 思考模式不再提供关闭选项:从「可以关」变为「关不掉」。
- API 迁移有破坏性变更:官方提示从 Opus 5 迁移时有 4 处参数会报 400 错误、2 处静默行为变化——除默认 effort 降档外,工具调用之间的进度文字从 text 块移到了 thinking 块,依赖 text 块做流式渲染的调用方需要适配。
- 回答风格更简洁:优先给出重要信息、减少不必要的术语,更严格遵循用户指定的写作规则。
- 能力边界收窄:多数网络安全类任务会被转交 Opus 4.8 处理。配套的安全评估显示,Opus 5.5 尝试突破隔离边界的行为较 Opus 5 减少约 85%,且均为低严重程度并自行报告。
实际任务效率的官方案例
以下数字来自 Anthropic 官方,注意其测试设置与真实业务可能有差异:
- 20 万行代码库审查修复:Opus 5.5 不到 3 小时;Opus 5 超过 20 小时,token 消耗为前者 2.5 倍。
- 财务建模 + 演示文稿:63 分钟完成(Opus 5 为 93 分钟),成本低 50%。
- 对比 GPT-6 Astra:FrontierCode 上成绩更高,单次任务成本约为其 20%;Terminal-Bench 4.0 达到相近成绩时成本约为其 40%。
与家族其他模型的关系
- Claude Sonnet 5.5(2026 年 9 月 29 日发布,一周后跟进):价格 $2 / $10(每百万 tokens),为 Opus 5.5 的一半,缓存读 $0.2 / 百万 tokens,速度较 Sonnet 5 提升 30% 以上且 token 消耗更低。官方基准中,Sonnet 5.5 在 Terminal-Bench 4.0 上取得 70.6%(Sonnet 5 仅 10.3%,且高于 Opus 5.5 的 66.4%),FrontierCode 在 High effort 设置下比 Sonnet 5 高 10 分、单项任务成本约为其 1/15——多项代码测试反超 Opus 5.5,成为 Anthropic 产品线中代码能力最强的模型,主打日常开发与文档类工作。
- 官方推荐策略变化:文档推荐语从「拿不准先用 Opus,最难的上 Fable」改为「不确定就从 Opus 5.5 开始」,Fable 5.1 退居为 Opus 5.5 调到 xhigh / max 仍搞不定的任务兜底。
选型建议
综合以上信息,给出如下建议:
- 日常编码与 Agent 主力直接用 Opus 5.5:编码基准更强、出字速度快 30% 以上、成本更低,发布当天即成为 Claude Code 默认模型。
- 省钱优先级:打满 Prompt Cache(缓存读 0.05 倍系数)→ 调整 EFFORT 档位 → 最后才考虑降级到 Sonnet 5.5。
- 延迟敏感的交互场景(结对编程、快速迭代)可评估快速模式,2 倍价格换 2.5 倍速度;长任务则坚持普通模式。
- 迁移前先跑回归:重点是 effort 默认档变化与工具调用进度文字的块位置变化,这两处是静默行为变更,测试不充分容易漏。
- 评测结论保持审慎:基准是厂商自选的,选型前建议用自己的真实任务集做小规模对比,再决定是否全量切换。