Claude Opus 5.5 发布:更快、更便宜,还是更可靠?
Claude Opus 5.5 面向长时间编码与知识工作,带来更快输出、更低单价、百万级上下文和自适应思考。本文解析能力、基准、成本与稳定性争议。
编者说明:本文根据 Jim Clyde Monge 发表于 Generative AI 的文章 《Anthropic Releases Claude Opus 5.5》翻译、整理,并结合 Anthropic 官方发布与模型文档核对关键规格。原文观点归原作者所有;文末 Dobby 内容为本站补充。

两家最大的 AI 公司在同一天推出了新模型。GPT-6 Sol 和 Luna 与 Claude Opus 5.5 都在 9 月 22 日亮相,前后只相差大约 90 分钟。先别谈什么“AI 放缓”:这场竞赛显然还在继续加速。
开发者尤其清楚,模型能力只是体验的一部分。长时间辅助编程时,令牌消耗、成本和订阅限额同样关键。对独立开发者来说,看着一天的额度在几分钟内被用完,体验并不好。Opus 5.5 正面回应了这些问题:Anthropic 降低了 API 单价、提高了部分订阅计划的使用限额,并表示新模型的输出速度更快。
作者在发布后进行了几个小时的聊天体验,第一印象非常直接:它确实很快。不过,他也强调自己还没有完成严格的同项目编程对照测试。因此,本文会把官方数据、第三方测量和个人体感分开来看。
与 Opus 5 相比,改变了什么?
Anthropic 将 Opus 5.5 定位为一款面向长时间智能体编程和知识工作的模型。官方文档显示,它提供 100 万 token 的上下文窗口,支持文本与图像输入,标准请求最多可生成 12.8 万 token。

Anthropic 称,新模型更擅长在大型代码库中持续工作,也更善于检查自己的修改。它的表达方式也做了调整:更早给出结论、减少术语堆砌,并在长会话里保持更清晰的说明。
这项变化看起来小,却很实用。让编程智能体修复一个问题时,我们真正需要知道的是:改了哪些文件、问题为什么发生、测试是否通过,而不是一段过长的自我叙述。Anthropic 的前后对比展示了 Opus 5.5 更聚焦的回答方式,但它能否在连续数小时工作后仍保持这种克制,还需要实际项目验证。

另一个重要变化是:Opus 5.5 的自适应思考始终开启。开发者可以设置 effort 等级,决定模型投入多少计算,但不能完全关闭思考。对于从 Opus 5 迁移 API 应用的人来说,不能只替换模型名称就结束。官方迁移指南列出了四项可能影响现有应用的行为变化,包括强制工具调用、思考块与对话的绑定关系,以及部分旧版 computer-use 工具不再被接受。
速度:主观感受和官方数据都很抢眼
在 Claude 桌面端使用了几个小时后,作者认为 5.5 的响应明显比旧模型快。不过,因为没有在同一项目、同一环境下计时,他没有给出自己的百分比。
Anthropic 的官方说法是,Opus 5.5 的输出速度比 Opus 5 提升超过 30%。这里说的是生成输出的速度,而一个完整的编程任务还包括读取文件、调用工具、运行测试和处理失败,因此实际端到端提升会因工作流而异。

早期用户反馈也提到了速度和界面问题定位能力。有人让它重建网站,几分钟内就完成了一个设计质量更好的版本。这些案例很有吸引力,但仍属于个别体验,不能代替可重复的评测。
Opus 5.5 还提供可选的 Fast mode。Anthropic 表示,它最高可达到标准模式 2.5 倍的速度,但输入与输出 token 单价也会翻倍。如何选择取决于任务:如果等待时间比推理成本更昂贵,Fast mode 可能值得;批量、非实时任务则未必。
Claude Code 负责人 Boris Chery 还让 Opus 5.5 和 Fable 5.1 把 HAProxy 从 C 移植到 Rust。两者都通过了几乎全部测试,但 Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,而且前者成本低 51%。这是一个很有代表性的长时编码实验,但仍应被视为特定任务中的结果,而不是对所有代码库的普遍保证。
基准测试:编码能力明显上升
Anthropic 公布的编码结果显示,Opus 5.5 相比 Opus 5 有明显进步。在测试命令行任务的 Terminal-Bench 4.0 中,Opus 5.5 得分为 66.4%,Opus 5 为 52.3%;同一对比表中,GPT-6 Astra 为 57.9%。

在评估代码修改是否达到可合并质量的 FrontierCode 中,Anthropic 报告 Opus 5.5 为 54.4%,Opus 5 为 48.0%,GPT-6 Astra 为 53.3%。在 Artificial Analysis 的 Intelligence Index 中,Opus 5.5 在最高 effort 设置下获得 58 分,知识工作类任务尤其突出,包括研究、分析以及产出可直接使用的交付物。
不过,能力和效率并不是一回事。Artificial Analysis 测得,Opus 5.5 在最高 effort 下每项任务大约生成 11.9 万个输出 token,而 Opus 5 约为 7.3 万个。虽然 5.5 的单位 token 更便宜,但在这组测试里,两者的单任务总成本大致相当。这再次说明:比较模型成本时,不能只看价目表,还要看完成同一任务实际消耗了多少 token。
一个难以回避的问题:性能会不会随时间下降?
更快、更便宜、基准更高,听起来几乎没有缺点。但原作者最担心的,是模型上线一段时间后出现“体感变差”。
开发者 Lon Lundgren 曾尝试量化早期 Fable 5 的变化。他记录 Claude Code 的使用情况,并比较 7 月与 8 月在 xhigh 或 max effort 下得到的思考 token。其样本覆盖 6,921 个 turn 和 36,374 次调用;按不同方法统计,中位思考量均出现下降。
这里必须谨慎:这是第三方观察,并不能证明 Anthropic 有意“削弱”模型。思考 token 的变化也可能受任务分布、产品策略、路由、系统提示或推理效率等多种因素影响。但用户对透明度的要求是合理的。如果一个付费模型在实际能力、计算预算或服务策略上发生可感知变化,平台应该清楚说明,而不是让用户猜测究竟是提示词、项目还是模型本身出了问题。
价格与使用额度
Claude API 上,Opus 5.5 的标准价格为每百万输入 token 4 美元、每百万输出 token 20 美元;Opus 5 分别为 5 美元和 25 美元。缓存读取价格也从每百万 token 0.50 美元降至 0.20 美元。对会反复读取相同项目文件、系统指令和上下文的编程智能体来说,缓存降价非常重要。

Fast mode 的价格为每百万输入 token 8 美元、每百万输出 token 40 美元。Anthropic 表示,在默认设置的典型工作负载中,Opus 5.5 的运行成本比 Opus 5 低约 40%。但实际节省多少,仍取决于任务类型、effort 设置、缓存命中率以及模型完成任务所需的 token 数量。
Anthropic 也提高了 Pro、Max、Team 和部分 Enterprise 订阅的五小时使用上限。对经常进行长时间编码或研究的人来说,额度是否足够,往往和模型智力本身一样影响体验。
结论:令人兴奋,但稳定性仍需时间证明
Opus 5.5 的早期信号很好:Claude 应用里的主观速度很快,官方编码基准显著提升,API 单价更低,缓存成本下降,同时保留了 100 万 token 上下文和 12.8 万 token 输出能力。对于生产级代码、复杂文档、computer use 和长时间智能体任务,它很可能成为许多团队的新默认选择。
但基准成绩不是全部。真正值得观察的是:它在数小时甚至数天的任务中是否稳定,迁移后的工具调用是否可靠,以及发布几周后用户感受到的能力是否仍与首发时一致。一个被用于写代码和做关键知识工作的模型,不仅要聪明,还要可预测、透明并且值得信任。
Dobby 中秋限时礼物:Opus 5.5 + DPDF30
Claude Opus 5.5 现已在 Dobby 上线。你可以直接在 Dobby 中使用它完成编程、研究、文档与智能体任务,无需单独配置官方 API。
为了庆祝中秋节,也因为 Dobby 刚刚获得 AWS 的新优惠资格,我准备了目前力度最大的优惠码:DPDF30。
- 适用于一次购买 250 美元及以上的预付额度;
- 可叠加 Dobby 现有折扣;
- 叠加后,使用成本可低于 GPT 与 Claude 官方 API 价格;
- 购买的预付额度永不过期。
这是限时活动,请尽快使用。具体适用范围、叠加规则和最终价格以 Dobby 结算页显示为准。访问 dobby.now,选择预付额度并在结算时输入优惠码 DPDF30。
来源与延伸阅读: