Tools

三大模型横评:Opus 5.5、GPT-6 Sol 与 Luna、MiMo v2.6 怎么选

4 min read ·

过去一周的模型市场出现了一个值得记住的结构性变化:9 月上旬 OpenAI 推出 GPT-6 Astra 旗舰,9 月下旬 GPT-6 Sol 与 Luna 跟进;9 月 22 日 Anthropic 发布 Claude 5.5 系列首个模型 Opus 5.5;同期小米 MiMo v2.6 以开放权重形式放出 Pro 与 Flash 双档。三个发布各自表述,但拼在一起指向同一件事——旗舰能力正在被拆解进更便宜的档位,竞争的主战场从「谁最聪明」转向「谁能把聪明卖得更便宜」。这篇横评按四个维度把它们放在同一张桌上。

维度一:价格与定位

先把 API 价格摆开(每百万 token):

模型            输入      输出      备注
Opus 5.5        4 美元    20 美元   缓存读 0.20,缓存写 5
GPT-6 Sol       2 美元    10 美元   较 GPT-5.6 Sol 半价
GPT-6 Luna      0.1 美元  0.5 美元  缓存读取再享九折
MiMo v2.6       开放权重            Pro 与 Flash 双档,自建或平台接入

三条产品线的定位差异清晰:Opus 5.5 是「官方宣称整体成本降 40% 的新旗舰」,输入输出各降 20%,缓存读取直降 60%;GPT-6 Sol 走中高端,宣称同等价位优于竞品并给更高用量限额,GPT-6 Luna 是极致性价比档,宣称高 effort 下匹敌上一代 Sol 而成本仅约百分之一;MiMo v2.6 则换了一条赛道,用开放权重覆盖私有化、本地化与高吞吐场景。

维度二:基准成绩的交叉阅读

直接对比要小心:各家自选基准、自选 effort 配置,数字不能横着硬比。更有信息量的是互相引用的部分

Anthropic 公布的对比里,Terminal-Bench 4.0 上 Opus 5.5 拿 66.4%,GPT-6 Astra 为 57.9%,GPT-5.6 Sol 为 37.3%;FrontierCode v1.1 上 Opus 5.5 以 54.4% 略高于 Astra 的 53.3%,且强调成本约为其五分之一。OpenAI 公布的对比里,AutomationBench 上 GPT-6 Sol(xhigh)拿 33.2%、单任务成本 0.27 美元,Claude Opus 5(max)为 26.9% 但成本是其 11 倍;DeepSWE v1.1 上 GPT-6 Sol(max)68.8%,距 Claude Fable 5 的 69.9% 只差 1.1 个百分点而成本低约 80%。

把双方各自的最强叙事叠起来读,结论反而清晰:在纯能力上,Opus 5.5 与 GPT-6 系列在编码与 agent 任务上互有胜负、差距不大;真正的分水岭在单位成本。这也是为什么两家都在公告里大字强调「以 X 分之一的成本达到同级表现」。MiMo v2.6 的公开数据主打 SWE-Bench Verified 双模式(非 thinking 73.7、thinking 78.6 的量级)与真实工作流的帕累托前沿叙事,建议以其官方文档为准并自行复测。

维度三:effort 调度机制

三家都把「思考多少」做成了显式参数,但设计取向不同:

  • Opus 5.5:low、medium(默认)、high、xhigh、max 五档,配合 adaptive thinking。官方客户数据显示低档任务用低档即可:Deloitte 用最低档捕获 72% 的已知 bug 而上代旗舰开高档只有 56%。注意这代不再支持关闭 thinking,低延迟路径要用 low effort 替代。
  • GPT-6 Sol / Luna:延续 effort 分档,xhigh 与 max 是官方对比里的常用配置;新增的工程细节很实用——调整 reasoning effort 或工具开关时不破坏缓存,还能显式设置缓存前缀断点,并配套 Prompt Caching Dashboard 做监控。
  • MiMo v2.6:提供 thinking 与非 thinking 两种模式,按任务切换,非 thinking 路径天然低延迟。

调度策略上三家的最佳实践高度一致:低档起步、失败升级、按任务价值定档。谁把这套级联做得越细,谁的账单越好看。

维度四:部署形态与生态

Opus 5.5 与 GPT-6 系列都是闭源 API,差别在渠道与功能面:Opus 5.5 同步上线 AWS、Google Cloud、Azure,支持零数据保留,Fast mode 提供 2.5 倍速选项;GPT-6 Sol 与 Luna 即刻进入 ChatGPT Work 与 Codex(Plus 及以上),Luna 还下放给了免费版桌面端,API 模型名分别为 gpt-6-solgpt-6-luna

MiMo v2.6 是三者中唯一的开放权重选项,1M token 上下文窗口对混合模态与长文档场景是实打实的差异化,Flash 档主打「以 Pro 级模型的水准处理日常任务、token 效率更优」的定位。对必须私有化、或日均 token 量大到 API 账单失控的团队,开放权重的边际成本优势无可替代;代价是要自建推理优化与运维能力。

选型建议

给一个按场景的速查:交互式编程与 agent 工作流,Opus 5.5 与 GPT-6 Sol 都是一线选择,前者编码基准略占优且缓存更便宜,后者价格减半且 ChatGPT 生态联动更强;海量高并发的简单任务,GPT-6 Luna 的百分之一成本几乎没有对手,适合做路由层的第一跳;私有化与数据主权,MiMo v2.6 开放权重是唯一解,1M 上下文是加分项;混合架构则是多数团队的终局——用低档模型处理八成流量,高档模型兜底长尾难题,路由规则用真实回归集持续校准。

算一笔直觉账可以更具体。假设一个日均处理 5000 万输入 token、1000 万输出 token 的文档处理服务:全量走 Opus 5.5 每天是输入 200 美元加输出 200 美元的量级;若八成流量路由到 GPT-6 Luna,这部分每天只要约 9 美元,剩余两成难题留给高档模型,账单可以压到原来的三分之一以下,而质量曲线由回归集守住。同样的架构在私有化场景里换成 MiMo Flash 打底、API 高档兜底,还能再省掉云侧的溢价,代价是养一个推理运维团队。

最后提醒一句:这一轮三家公告里的对比数字都经过精心选择,任何「谁碾压谁」的结论都站不住。把各家自报的数据当线索,把自己业务上的回归集当法官,才是这批「旗舰能力下沉」发布真正的正确打开方式。

Frequently asked questions

这三家发布的时间线是怎样的?
OpenAI 的 GPT-6 Astra 旗舰于 9 月上旬发布,Sol 与 Luna 两款性价比档在 9 月下旬跟进并登陆 ChatGPT 与 API;Anthropic 于 9 月 22 日发布 Claude 5.5 系列的首个模型 Opus 5.5;小米 MiMo v2.6 的 Pro 与 Flash 双档于 9 月以开放权重形式发布并同步上线多家推理平台。三者都在一周左右的时间窗内,构成了这一轮「旗舰能力下沉」的完整拼图。
API 价格梯度大概是什么水平?
以每百万 token 计:Opus 5.5 输入 4 美元、输出 20 美元;GPT-6 Sol 输入 2 美元、输出 10 美元;GPT-6 Luna 输入 0.1 美元、输出 0.5 美元,缓存读取还有九折。MiMo v2.6 是开放权重,成本取决于推理平台或自建集群。粗略地说,Sol 约为 Opus 5.5 的一半,Luna 约为 Sol 的二十分之一,MiMo 自建时边际成本可以更低。
effort 调度机制三家有何不同?
Opus 5.5 提供 low、medium、high、xhigh、max 五档加 adaptive thinking,且不再支持关闭 thinking,默认档即可对标上代旗舰的高档表现。GPT-6 系列延续 effort 机制并新增调节参数不破坏缓存的改进。MiMo v2.6 提供 thinking 与非 thinking 两种输出模式可切换。共同趋势是:把「思考多少」变成显式参数,让同一颗模型服务多个价位。
MiMo v2.6 适合什么团队?
两类场景最合适:一是对数据主权敏感、必须私有化部署的团队,开放权重加宽松许可意味着模型可以跑在自己的机房里;二是高吞吐低成本的大规模调用,Flash 档主打日常任务与 token 效率,Pro 档对标 Pro 级模型的工作流表现,并配备 1M token 上下文窗口适配混合模态输入。代价是需要自己承担推理优化、版本升级与运维。
没有统一第三方榜单时怎么对比?
只看各家自报数据会踩坑,因为厂商倾向选自家占优的基准与 effort 配置。可操作的替代做法有三:一,在自家真实任务上建小型回归集,用相同的提示词与档位复测候选模型;二,优先看交叉引用的数据,比如 Anthropic 引用 GPT-6 成绩、OpenAI 引用 Claude 成绩的部分,双方不敢乱写对方的数字;三,盯第三方评测机构的更新,关键维度看每任务成本而不只是分数。
// next.txt ›

Some outbound links in this post are affiliate links — see disclosure.