Claude Sonnet 5.5 使用指南:Medium、High 还是 Max?

Sonnet 5.5 在 Medium 与 High 档位很有吸引力,但 Max 的 token 成本可能反超 Opus。本文用基准、成本与工作负载拆解最佳使用方式。

Share
Claude Sonnet 5.5 的 Medium、High 与 Max 推理档位连接到不同 token 成本路径

编者说明:本文根据 Caspar Bannink 发表于 The AI Brief 的文章 《Claude Sonnet 5.5 Is Amazing. But Where Should You Use It?》翻译、整理,并对照 Anthropic 官方发布资料和 Artificial Analysis 当前数据核验。原文发表于 2026 年 9 月 29 日,观点归原作者所有。

快速结论:Claude Sonnet 5.5 是一次非常有吸引力的升级,但并不是每个任务都应该把推理强度拉到最高。Medium 适合边界清晰的实现工作,High 是更值得关注的主力 Agent 档位,而 Max 更适合作为失败后的升级路径,不应成为默认设置。

Claude Sonnet 5.5 发布主题插图
Claude Sonnet 5.5 发布主题图。图片来源:原文

Claude Sonnet 5.5 是一段时间以来,第一个让作者真正想主动使用的 Sonnet 版本。Sonnet 5 虽然版本号更新、宣传也不少,却没有给模型路由策略带来足够理由:需要严肃思考时用更强模型,需要便宜的实现型 Agent 时,市场上又有很多替代品。

Sonnet 5.5 看起来终于修复了这个定位问题。作者在写作时还没有亲自长期使用,因此这是一篇基于发布数据的首日分析,而不是实测评测。但这些数字已经足以支持一个明确的试验方案:让 Opus 负责规划和高难度判断,再把实现工作交给 Sonnet。

问题也很明显。越深入看数据,Sonnet 5.5 越像 Anthropic 近期一个趋势的典型案例:为了把分数推得更高,Claude 愿意消耗非常夸张的 token。在 Medium 和 High 档位,这种交换可能很划算;到了 Max,成本曲线就开始失控。

Sonnet 5.5 是一个非常出色的模型,但我绝不会默认开启 Max。真正的问题是:有用的 Sonnet 在哪里结束,“token 吞噬者”又从哪里开始?

Sonnet 终于变得有意思了

Anthropic 将 Sonnet 5.5定位为 Opus 5.5 更快、更便宜的搭档。Opus 适合需要持续判断的复杂工作;Sonnet 则面向范围明确的日常任务、修复 Bug、编码以及文档、幻灯片和表格制作。

API 定价也支持这种分工:Sonnet 5.5 每百万输入 token 2 美元、每百万输出 token 10 美元,正好是 Opus 5.5 的 4 美元和 20 美元的一半。Anthropic 还称 Sonnet 5.5 的输出速度比 Sonnet 5 快 30% 以上,并且完成相同工作通常使用更少的 token。

发布数据让 Sonnet 5 看起来几乎像另一个时代的产品。Anthropic 报告 Sonnet 5.5 在 GDPval-AA 上从 1449 提升到 1844,在 AA-Briefcase 上从 1359 提升到 1811;CursorBench 4.0 从 34.1% 提升到 55.5%,Chartography 从 15.6% 提升到 61.6%。这些是厂商发布的结果,不能直接当成生产环境优越性的独立证明,但代际提升确实非常大。

Anthropic 发布的 Claude Sonnet 5.5 基准测试对比
Anthropic 发布的 Sonnet 5.5、Sonnet 5、Opus 5.5 和其他模型基准对比。图片来源:原文

最奇怪的数字来自 Terminal-Bench 4.0:Anthropic 报告 Sonnet 5.5 为 70.6%,Opus 5.5 为 66.4%,而 Sonnet 5 只有 10.3%。一个 Sonnet 在 Agent 编码评测上超过新 Opus,值得格外关注,因为“负责实现”本来就应该是 Sonnet 的工作。

但这并不等于“Sonnet 全面优于 Opus”。在 Anthropic 自己的表格中,Opus 仍领先多数广义推理和知识工作测试;不同评测的 Harness 与 effort 设置也会影响排序。更合理的解释是:Sonnet 5.5 不是缩小版 Opus,它可能在执行和实现上形成了自己的甜蜜点。

FrontierCode 的结果进一步说明,更多推理不一定自动带来更好答案。Sonnet 5.5 在 Xhigh 得到 52.1%,在 Max 却只有 46.2%。Max 给模型更多思考空间,却无法保证额外思考一定有效;在这个评测中,过度审查和额外修改甚至可能导致超时或偏离任务范围。

独立对比更能说明升级幅度。Artificial Analysis 将 Sonnet 5.5 High 与 Sonnet 5 Max 比较时,Intelligence Index 为 47 对 38;每任务成本约为 1.08 美元对 5.09 美元;输出 token 约 3.4 万对 11.8 万,推理 token 约 1.8 万对 8.8 万。这才是本次发布真正令人印象深刻的部分:只要 effort 设置合理,5.5 可以比上一代更聪明,同时消耗更少计算量。

Anthropic 占据了榜单顶部

从更广的排行榜看,Anthropic 的位置非常强。原文写作时,Artificial Analysis 把 Opus 5.5 Max 排在 58 分,Sonnet 5.5 Max 排在 56 分。按不同 effort 变体展开,Opus 5.5 Xhigh 也是 56,Opus 5.5 High 为 54。当前模型页仍显示 Sonnet 5.5 Max 为 56 分,但排名会随新模型和评测版本持续变化,因此应把分数看得比名次更重要。

Claude Sonnet 5.5 在 Artificial Analysis 的性能和成本摘要
Sonnet 5.5 Max 的 Intelligence Index、成本与 token 使用摘要。图片来源:原文

这张摘要卡也是兴奋开始变成怀疑的地方。Sonnet 5.5 的 56 分很优秀,但 Artificial Analysis 当前显示其 Intelligence Index 每任务成本约为 7.62 美元,完整评测共生成约 4.1 亿输出 token。该机构称其 Max 平均每任务约 19.3 万输出 token,是它测量过的最高 token 用量之一。

这种行为并不只发生在 Sonnet。原文对比的近似数字为:Opus 5.5 Max 每任务约 11.9 万输出 token,Fable 5.1 Max 约 7.8 万,GPT-6 Astra Max 约 2.7 万,而 Sonnet 5.5 Max 达到约 19.3 万。精确数值依赖评测组合和 Harness,但方向很难忽略。

我们无法从外部数据知道 Anthropic 的内部推理上限,也不能据此判断 API 后面的架构。可观察到的现象是:Anthropic 更愿意让模型在最高 effort 下继续花 token,以换取更高分数。这种策略确实取得了极强成绩,却也让“每百万 token 的标价”越来越难代表 Claude 的实际任务成本。

token 曲线开始变得难看

Sonnet 5.5 的 effort 曲线非常极端。根据原文引用的 Artificial Analysis 数据:

  • Medium:Intelligence 约 41,每任务约 0.59 美元,约 1.9 万输出 token,其中约 8000 为推理 token。
  • High:Intelligence 约 47,每任务约 1.08 美元,约 3.4 万输出 token,其中约 1.8 万为推理 token。
  • Xhigh:Intelligence 约 52,每任务约 2.74 美元,约 7.4 万输出 token,其中约 4.8 万为推理 token。
  • Max:Intelligence 约 56,每任务约 7.60 美元,约 19.3 万输出 token,其中约 14.2 万为推理 token。

从 Medium 到 High 的提升是合理的:多花约 0.49 美元,换来 6 个指数点。输出 token 增长约 79%,推理 token 增长一倍多。如果让 Agent 处理较大的编码任务、较模糊的需求,或者允许它做一些局部决策,High 完全说得通。

Xhigh 开始令人不安。相比 High,只多 5 分,输出用量却翻倍以上,推理量约增至 2.7 倍。Max 则把同一趋势推到悬崖外:High 到 Max 增加 9 分,但任务成本约变成 7 倍,总输出约增至 5.7 倍,推理 token 接近 8 倍。

Claude Sonnet 5.5 不同 effort 档位的 token 消耗
Sonnet 5.5 不同 effort 档位的输出与推理 token 曲线。图片来源:原文

因此,“token 吞噬者”并不只适用于 Max。Medium 已经在这个指数中使用约 1.9 万输出 token,High 为 3.4 万。模型随着推理时间增加而显著变强,但性能曲线始终伴随大量 token 增长,Max 只是让这种胃口变得无法忽视。

需要补充一个重要细节:在相近的实用性能下,Sonnet 5.5 仍比 Sonnet 5 高效得多。Anthropic 官方称 5.5 完成同样任务通常需要更少 token,独立对比也支持这种代际改善。问题不是“5.5 比上一代浪费”,而是当你不断调高 effort 时,它相对于同档竞争模型可能花费过多输出预算。

Sonnet 5.5 智能与单任务成本位置图
智能水平与单任务成本对比:Sonnet 5.5 在不同 effort 下都有邻近竞争者。图片来源:原文

Artificial Analysis 的结论很直接:Sonnet 5.5 不在“智能与单任务成本”的 Pareto 前沿上。高 effort 会撞上 Opus 5.5,低 effort 又遇到成本相近或更低的 GPT-6 Sol、Astra 配置。Sonnet 因此可以在排行榜上非常惊艳,却又很难在路由表里拥有毫无争议的位置。

High 与 GPT-6 Sol 怎么选?

最清楚的例子是 Sonnet 5.5 High 对 GPT-6 Sol Max。按照原文引用的同一套 Artificial Analysis 方法,Sonnet High 为 47 分、每任务约 1.08 美元;Sol Max 为 48 分、每任务约 1.06 美元。两者 API 定价也完全相同:输入 2 美元、输出 10 美元每百万 token。

两者 token 用量也接近。Sonnet High 平均约 3.4 万输出 token,其中约 1.8 万为推理;Sol Max 约 3.1 万输出,其中约 2.1 万为推理。在 Artificial Analysis 的 Harness 中,两者 Terminal-Bench 4.0 都是 44%。Sol 在 SciCode 和 AutomationBench 略领先,Sonnet 则在 AA-Briefcase 和 GDPval-AA 领先。

因此,High Sonnet 不只是“可用”,它很可能正是最值得测试的设置。但很难把它称为绝对便宜,因为 Sol Max 提供了几乎相同的综合智能、任务成本和 token 量。选择必须回到具体工作负载:Sonnet 可能更适合 Agent 型知识工作与执行任务,也可能因为同属 Claude 生态而更好地遵循 Opus 制定的计划;Sol 在一些编码和自动化指标上更强。公开数据无法支持一种模型在所有任务上具有经济优势。

这也改变了我们对 Max 的理解。Sonnet Max 比 Sol Max 高 8 个指数点,额外性能真实存在;但它使用约 19.3 万而不是 3.1 万输出 token,任务成本为约 7.60 美元而不是 1.06 美元。Anthropic 给你更长的推理跑道,也会对这条跑道收费。

Opus 让 Sonnet Max 失去意义

Anthropic 自家产品线里的比较更尖锐。原文引用的 Artificial Analysis 数据显示,Sonnet 5.5 Max 与 Opus 5.5 Max 分别为 56 和 58 分;Sonnet 每任务约 7.60 美元,Opus 约 5.98 美元。

这和 API 价格卡给人的直觉正好相反。Sonnet 的单 token 价格是 Opus 的一半,但 Sonnet Max 使用约 19.3 万输出 token,Opus Max 约 11.9 万。所谓“经济型模型”花掉足够多的 token 后,不但抹去单价优势,实际任务成本还可能更高。

Xhigh 对比更难解释:Opus 5.5 Xhigh 同样达到 56 分,约 3.46 美元一项任务。若需要这一等级的通用推理能力,很难说明为什么要选择 Sonnet Max,用超过两倍成本获得相同综合分数。

Sonnet 5.5 Max 与 Opus 5.5 和 GPT-6 Sol 的任务成本对比
Sonnet 5.5 Max 的单任务成本高于 Opus 5.5 Max,也显著高于 GPT-6 Sol Max。图片来源:原文

Agent 编码结果是唯一不能彻底排除 Sonnet 高 effort 的理由。Anthropic 自己的 Terminal-Bench 数据中,Sonnet 高于 Opus;Artificial Analysis 的 Harness 也给出类似方向。可能存在一类编码任务,Sonnet 更长的推理轨迹确实值得付费,这需要真实工作流测试,不能只看综合成本曲线。

但 Max 应该是升级路径,而不是默认值。如果 High 因为任务确实需要更多自主性而失败,可以测试 Xhigh,再和 Opus 对比。如果某类任务经常需要 Max 级别推理,通常一开始就应路由给 Opus。一个执行型 worker 一旦比你想避免调用的 orchestrator 还贵,就不再经济。

我会在哪里使用 Sonnet 5.5?

综合来看,Sonnet 5.5 比只看 Max 数字时显得更有价值:

  • Medium:便宜的实现者。适合已有良好计划、边界明确的编码、修复、文档和表格任务。
  • High:真正有吸引力的主力 worker。它比 Sonnet 5 强很多,在智能和成本上接近 GPT-6 Sol Max,同时仍适合被 orchestrator 频繁调度。
  • Xhigh:谨慎测试的升级档。只在 High 明显不足、任务又偏执行型时使用,并与 Opus 做 A/B 对比。
  • Max:关闭默认开关。保留给极少数能证明长推理轨迹值得的任务。

Sonnet 在这个位置并没有垄断优势。Sol Max 几乎紧贴 High,Sonnet 一旦继续向上调,Opus 很快就更具吸引力。Artificial Analysis 对 Pareto 前沿的判断准确概括了这种尴尬:Sonnet 5.5 很优秀,但它曲线上的每一段都有一个邻近竞争者,使路由决策不那么显然。

Anthropic 毫无疑问实现了强大的智能水平。Opus 5.5 领先,Sonnet 5.5 紧随其后,多种 Claude effort 变体密集占据榜单前列。这是一组非常强的模型。

但我们不应只庆祝分数,而忽视推理预算。一个困难的编码 Agent 如果通过长时间工具调用真正解决问题,其价值当然可能远超 API 账单;可当额外思考只换来少数几个基准点,成本却增加七倍,它就不适合作为默认策略。

最终路由建议:Medium 是便宜的实现者,High 是最值得测试的 worker,Max 是应保持关闭的 token 吞噬者。

在 Dobby 上直接使用 Sonnet 5.5

Claude Sonnet 5.5 现已在 Dobby 上线。你可以直接把编码、研究、文档、幻灯片或自动化任务交给 Dobby,并根据任务难度选择合适的模型。最实用的方式是先用 Sonnet 5.5 处理范围明确的执行工作;遇到真正需要更强判断的任务,再切换到 Opus 等更高阶模型,而不是把所有请求默认推到最高 effort。

Dobby 让你在同一个项目中切换主流模型,并把浏览器、文件、Shell 与应用操作放进托管沙箱执行。国内用户也可以直接使用,支持中文界面、微信支付和支付宝,无需自己配置 API、网关或服务器。

来源