我重新给 13 款 AI 模型排了名:一切都变了
最新 13 款 AI 模型实战分级:Opus 5.5 负责规划,GPT-6.1 Sol 负责实现,Sonnet 5.5 负责复核,并从能力、成本与任务路由重新排序。
编者说明:本文根据 Caspar Bannink 发表于 The AI Brief / Medium 的文章 《I Re-Ranked 13 AI Models. Everything Changed.》翻译、整理。原文观点、排名与测试结论归原作者所有。文末的 Dobby 章节为 DrPang.AI 补充内容。

我在 25 天前发布了上一版 AI 模型分级榜。现在,那份榜单已经错了。更离谱的是,这次更新的草稿昨天才写完,发布前也已经过时。
Claude Opus 5.5 取代了我此前放在榜首的模型。小米把廉价开放模型进一步推近前沿水平。Anthropic 发布 Sonnet 5.5,让“推理强度”几乎和模型名称本身一样重要。紧接着,GPT-6.1 Sol 登场:能力接近 Astra,价格却足以让它成为日常实现工作的主力。
排名变化,是因为模型承担的工作发生了变化。现在,我不再执着于找一个什么都能做的模型,而是更关心如何为规划、实现、复核、自主工具调用,以及围绕这些昂贵步骤的大量低成本工作,分别选择合适的模型。
我仍然喜欢分级榜这种形式,因为它迫使我真正做出选择。但这里评判的标准,是我今天会把什么工作路由给什么模型。一个模型即使整体智能稍弱,只要它能以极低成本把某一类任务做得特别好,也可能获得更高等级。
- S 级:Claude Opus 5.5
- A 级:GPT-6 Astra、GPT-6.1 Sol、Claude Sonnet 5.5、Xiaomi MiMo-V2.6-Pro、GPT-6 Luna
- B 级:Muse Spark 1.3、GLM-5.3 Flash、Xiaomi MiMo-V2.6-Flash
- C 级:Grok 4.7、Kimi K3、DeepSeek V4.1 Flash
- F 级:Gemini 3.8 Flash
变化最大的是 Luna 跃升到 A 级,以及 GPT-6.1 Sol 不再只是一个便宜的编码模型。Luna 则从相反方向取胜:它便宜到几乎到处都能找到适合它的工作。
S 级:Claude Opus 5.5
Claude Opus 5.5 仍然是我希望用来做昂贵决策的模型。但我已经不再默认把它开到最高推理强度。Artificial Analysis 目前给 Opus 5.5 Medium 的 Intelligence Index 评分是 51,每个评测任务的估算成本约为 1.34 美元。它生成的输出 token 远少于 Max 配置,同时仍领先于我希望放在技术栈下层的模型。
规划者需要的正是这种能力结构。我希望 Opus 理解代码仓库,判断改动应该如何融入现有架构,把任务拆解成合理的实现步骤,并定义什么样的结果才算正确。当它已经解决了最困难的问题,就没有必要继续消耗 Max 级别的推理 token 去写每一行代码。
现在,我把 Opus 5.5 Medium 当作编排者与规划者。Medium 已经足够强,让我在面对模糊任务时仍能使用最信任的模型;与此同时,它的成本与 Sonnet High 足够接近,因此让 Opus 负责规划并不会显得不负责任。真正值得的任务,我仍会调高推理强度,但 Max 已不再是我面对“困难任务”时的默认答案。
在知识工作中,它也仍然属于 S 级。长篇报告、混乱的资料、架构决策,以及任何必须先判断“什么重要”才能回答的问题,都是我最愿意为 Opus 付费的场景。问题范围缩小后,更便宜的模型才开始体现价值。
A 级:真正承接大量任务的模型
A 级现在有五款非常不同的模型。对我来说,它们都没有取代 Opus,但每一个都有充分理由承担更大的工作量。
GPT-6 Astra:自主操作
当困难点在于“操作软件”时,GPT-6 Astra 仍然是我的首选。Artificial Analysis 的当前榜单显示,它在面向 Agent 和专业工作的评测中仍接近顶端。相比在纯文本推理基准上多拿几分,我更在意这种能力形状。
浏览器或电脑操作 Agent,以及那些每执行一步都必须观察环境是否变化的长链条工作流,是 Astra 最适合的任务。它的价格高到不应该拿去做常规转换;但如果一次错误的工具决策就可能毁掉整次运行,那么额外成本就容易合理化。
GPT-6.1 Sol:更低价格,接近 Astra
GPT-6.1 Sol 是最能改变我编码技术栈经济性的模型。Artificial Analysis 目前测得 GPT-6.1 Sol Max 的 Intelligence Index 为 52,只比 GPT-6 Astra 低 1 分;但每个评测任务的估算成本,Sol 约为 0.72 美元,Astra 则约为 3.26 美元。OpenAI 给出的价格为每百万输入 token 2 美元、每百万输出 token 10 美元,拥有 105 万 token 上下文窗口,并提供从 Low 到 Max 的推理强度。
因此,我把它看作“迷你 Astra”。Astra 仍然更适合困难的自主电脑操作,以及一次错误工具调用就可能让整个流程失败的任务。但在编码与专业工作中,两者差距已经足够小,让我会更频繁地先用 6.1 Sol,再要求 Astra 证明升级值得。
我最看重的是 High 配置。Artificial Analysis 测得 GPT-6.1 Sol High 在同一指数上获得 50 分,每个任务约 0.32 美元;Max 是 52 分,约 0.72 美元。对一个已经拿到明确计划、验收标准和有限文件范围的实现 Agent 来说,为多 2 个综合分付出超过两倍的评测成本,不适合作为默认策略。
这个角色也解释了为什么我仍把 Opus 排在它前面。Sol 能解决复杂的实现细节,但如果任务从架构模糊性开始,而不是一份具体变更请求,我更信任 Opus。我希望昂贵模型先决定应该做什么;一旦决定完成,Sol 6.1 的能力与价格足以承担大部分实际工作。
随后,再让 Sonnet 5.5 作为来自另一模型家族的复核者。当前综合分并不会强迫我这样选择;我是在复核阶段刻意为不同的行为模式付费,而不是让实现者批改自己的作业。
Claude Sonnet 5.5:复核者
Sonnet 5.5 是这份榜单里最有意思的新模型之一,因为我认为它的最佳设置是 High,而不是 Max。Anthropic 把 Sonnet 5.5 定位为面向明确任务、速度更快且价格更低的 Opus 补充,并将 High 设为 API 默认值。Anthropic 还表示 Haiku 5.5 会在未来几周推出,这可能会改变廉价工作模型的排名。

Max 的基准成绩很漂亮,但经济性却很奇怪。Artificial Analysis 测得 Sonnet 5.5 Max 的指数为 56,只比 Opus Max 低 2 分;然而它会使用海量输出 token,每个 Intelligence Index 任务的成本约为 7.60 美元。High 是 47 分,每个任务约 1.08 美元。真正值得我使用的 Sonnet,是 High。
我会在另一个模型完成编码后,让 Sonnet 5.5 High 担任复核者。它需要阅读计划、检查 diff,并真正判断实现是否扎实。好的复核者应该挑战捷径、发现奇怪选择,也应该注意到某个方案虽然“技术上能跑”,却没有满足任务意图。
我喜欢让 Sonnet 担任这个角色,还有另一个原因:它与实现者来自不同实验室。我无法证明跨实验室复核一定会发现更多漏洞,但 OpenAI 与 Anthropic 模型确实有不同的习惯。相比再让一个 OpenAI 模型用相似偏好查看同一份代码,我更愿意让 Sonnet 质疑 Sol 的实现。
MiMo-V2.6-Pro:惊人的性价比
MiMo-V2.6-Pro 仍然是我的 A 级性价比之选。在 Artificial Analysis 当前与 GLM-5.3 Flash 的对比中,MiMo Pro 的整体 Intelligence Index 更高,而每个评测任务的成本依然极低。过去那种“因为中国模型便宜才用它”的妥协,正在越来越难与“因为它本来就很好,所以用它”区分开。
如果我按纯 API 价格运行编码 harness,我会积极测试 MiMo Pro。Opus 仍是我更信任的规划者,Sonnet 也能提供更好的跨实验室复核;但 MiMo 已经强到足以迫使大量普通实现与推理任务证明,为什么它们应该被发送给更昂贵的模型。
GPT-6 Luna:近乎免费的智能
Luna 是我上调幅度最大的模型。Artificial Analysis 目前给 GPT-6 Luna XHigh 的 Intelligence Index 评分为 34,每个任务的估算成本却只有大约 0.04 美元。API 价格是每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。这简直离谱。
我不需要 Luna 设计一次架构迁移。我需要它总结和探索混乱上下文,做数据提取、Schema 调整,以及围绕昂贵工作执行简单工具调用。XHigh 的能力已经足以让其中很多任务不再像“小模型工作”,但账单几乎没有变化。
对美国托管的廉价模型而言,Luna 目前是这一类别里的王者。唯一变量是 Haiku 5.5。Anthropic 表示,Haiku 5.5 专门面向高流量、成本敏感的应用。如果它能以同样夸张的价格提供强大推理,我可能会替换两者的位置。在看到正式价格和独立测试前,Luna 留在 A 级。
我的编码技术栈变了
理解这份排名最简单的方法,是看我现在真正使用的编码流程。昂贵的决定发生在规划与复核阶段;夹在中间的实现,是一个便宜得多、边界明确的任务。

现在的主路径是:Opus 5.5 Medium → GPT-6.1 Sol High → Sonnet 5.5 High。Muse Spark 1.3 XHigh 位于主路径旁边,负责简单复核、后端工作,以及不值得启动昂贵循环的小型编码任务。
Sol 6.1 High 是这条路线的经济中心。Artificial Analysis 测得它以约 0.32 美元的单任务成本获得 50 分,而 Max 以约 0.72 美元获得 52 分。对已经完成规划的实现工作,我宁愿购买两次 High,也不愿默认用 Max 为 2 个额外综合分付费。
模型仍需要良好的交接。High 之所以便宜,是因为我没有要求它每次都重新发现架构。它会得到具体变更、验收标准、相关上下文,以及允许修改的文件。这正是强大实现者可以明显低于设计者成本的任务。
Opus 仍负责架构。Sol 6.1 接收边界明确的改动、验收标准和允许触碰的文件,在不重新开启每一项架构决策的前提下写代码。然后,让 Sonnet 带着怀疑精神复核。
Sonnet High 更贵,是因为我想在复核中购买另一种推理方式。它应根据计划检查结果,阅读周围代码,并判断 Sol 是否走了会在未来制造麻烦的捷径。Artificial Analysis 的当前总榜中,Sol 6.1 High 实际上高于 Sonnet High,所以我不再因为 Sonnet 在综合分上“看起来更聪明”而使用它。我用它,是因为 Anthropic 模型行为不同,而我希望复核者愿意挑战 OpenAI 的实现者。
这种三模型分工仍比让 Opus 承担每个阶段更省钱,而且质量下限比一天前更高。Sol 6.1 是第一个让我觉得,普通工作可以减少规划说明而不会立即后悔的 Sol 版本。
Muse Spark 1.3 则是廉价辅助工作者。我并不喜欢把它当作通用编码模型,它在 UI 工作上确实很差;但对简单后端改动和快速复核,我已经订阅的 Muse Code 提供了大量额度,边际成本低得近乎可笑。我还会让它做重复编辑和处理任务,并用 XHigh 运行,因为即使失败,代价也很低。
Spark 可以一边待在 B 级,一边频繁出现在我的工作流里。A 级留给那些拥有异常强大角色定位的模型;B 级模型仍可以在另一个模型降低不确定性之后,成为优秀的工作者。
B 级:实用型工作者
Muse Spark 1.3 现在位于 B 级首位。订阅制彻底改变了经济性,让我可以不考虑 token 成本,随手把后端任务和小型复核交给它。但我会让它远离视觉工作,因为它从未给我足够信心去承担后续清理。
GLM-5.3 Flash 仍然是最容易推荐的廉价编码模型之一。MiMo Pro 削弱了它初次出现时的震撼感,但核心吸引力没有改变:面对大量边界明确的实现任务,我很乐意运行这种模型,而不是让每个分支都支付前沿价格。
MiMo-V2.6-Flash 是小米路线中的批量工作者。Luna 获得 A 级,是因为它在美国托管生产环境中的角色太清晰,而且价格低得夸张。当部署约束和供应商适配更合适时,MiMo Flash 同样是优秀选择。
C 级:有能力,却被市场挤压
Grok 4.7、Kimi K3 与 DeepSeek V4.1 Flash 都因为同一个令人不快的原因落入 C 级:我能使用它们,却很难构建一个让其中某个模型成为明显首选的工作流。在今天的市场里,“不错”已经不够。
Grok 有能力,但我已经有 Opus 负责规划、Astra 负责自主工具工作、Sonnet 负责复核、GPT-6.1 Sol 负责低成本实现、Luna 负责微型调用。开放模型一侧,Kimi 会遇到 MiMo;DeepSeek Flash 则面临同样拥挤的廉价工作者市场。这些并不意味着它们差,只是每个角色现在都有两三个优秀候选者,它们被挤压了。
路由评分比智能评分更苛刻。一个好模型可以待在 C 级,因为路由器需要一个明确理由才会选择它。
F 级:Gemini 3.8 Flash
Gemini 3.8 Flash 终于填上了这份榜单缺失的 F 级。
有趣的是,它的头条速度确实很出色。Artificial Analysis 目前测得 High 配置的 Intelligence Index 为 41,输出速度约为每秒 242 token。问题在于这个数字周围发生了什么:同一评测报告显示它使用了海量输出 token,每个 Intelligence Index 任务的成本约为 1.24 美元。
所以,Flash 确实能极快地吐出 token,但它也会吐出很多。这削弱了实际速度优势,也让经济性远没有“Flash”这个名字暗示得那么精彩。我可以用 Luna 处理微型生产调用,用 GPT-6.1 Sol 处理低成本实现,用 MiMo 或 GLM 做高性价比编码,在确实需要重工具自主性时再用 Astra。
Google 的多模态技术栈仍然让 Gemini 拥有真正的专长场景,尤其当视频或更广泛的 Google 生态是任务核心时。但这份排名基于我真正会路由的工作;在这些工作里,我找不到选择 Gemini 3.8 Flash 的理由,所以它获得 F。
我会采用的模型组合
当前的高级编码路线是:Opus Medium 负责计划,GPT-6.1 Sol High 负责实现,Sonnet High 负责复核。Muse Spark XHigh 接收便宜的后端任务与简单复核溢出;Astra 处理重工具、自主执行工作;如果我想把更多技术栈压到低 API 成本,MiMo Pro 是第一个会测试的模型。
然后,Luna 会吸收大量其他任务:总结、探索、提取,以及简单工具调用周围的路由。几乎不用花钱就能完成这些步骤,会改变我愿意构建多少自动化。如果 Haiku 5.5 真像 Anthropic 暗示的那样又强又便宜,这个位置可能在几周内再次变化。
按现在的发布节奏,这份分级榜很快也会过时。真正有用的问题,已不再是哪款模型的基准分最高。我关心的是:谁拿到计划,谁编写代码,谁被付费来怀疑它,以及谁便宜到让我不再担心 token 账单。
原作者 Caspar Bannink 是一名独立技术创始人,正在开发 AI 驱动的租房工作流产品 HomeScout。他在 Medium 的 CasparAI 以及 LinkedIn 上撰写关于 AI 模型、Agent 与背后系统的文章。
DrPang.AI 补充:在 Dobby 里直接体验这些模型
文中提到的大多数模型都可以在 Dobby 上使用。你不必分别注册多个模型平台、维护多套 API 配置,或者为每个供应商重新搭建工作环境;可以在同一项目中根据任务切换模型,把高端模型用于规划与复核,把速度更快、价格更低的模型用于实现、总结、提取和批量工作。
例如,你可以借鉴原作者的路由思路:让 Opus 5.5 负责理解复杂问题与制定计划,让 GPT-6.1 Sol 执行边界明确的实现,再让 Sonnet 5.5 从不同模型家族的视角复核;需要自主浏览器或电脑操作时选择 Astra,需要低成本辅助工作时再根据项目选择 Luna、MiMo、GLM、Kimi、DeepSeek 或 Grok 等模型。具体可用型号以 Dobby 当前模型列表为准。
Dobby 是托管式 AI Worker 平台,任务在隔离沙箱中执行,用户无需安装网关或维护服务器。它提供中文界面,并支持微信支付和支付宝。想亲自比较这些模型,或者建立自己的“规划 → 实现 → 复核”工作流,可以直接前往 dobby.now。