过去一周的模型市场出现了一个值得记住的结构性变化:9 月上旬 OpenAI 推出 GPT-6 Astra 旗舰,9 月下旬 GPT-6 Sol 与 Luna 跟进;9 月 22 日 Anthropic 发布 Claude 5.5 系列首个模型 Opus 5.5;同期小米 MiMo v2.6 以开放权重形式放出 Pro 与 Flash 双档。三个发布各自表述,但拼在一起指向同一件事——旗舰能力正在被拆解进更便宜的档位,竞争的主战场从「谁最聪明」转向「谁能把聪明卖得更便宜」。这篇横评按四个维度把它们放在同一张桌上。
维度一:价格与定位
先把 API 价格摆开(每百万 token):
模型 输入 输出 备注
Opus 5.5 4 美元 20 美元 缓存读 0.20,缓存写 5
GPT-6 Sol 2 美元 10 美元 较 GPT-5.6 Sol 半价
GPT-6 Luna 0.1 美元 0.5 美元 缓存读取再享九折
MiMo v2.6 开放权重 Pro 与 Flash 双档,自建或平台接入
三条产品线的定位差异清晰:Opus 5.5 是「官方宣称整体成本降 40% 的新旗舰」,输入输出各降 20%,缓存读取直降 60%;GPT-6 Sol 走中高端,宣称同等价位优于竞品并给更高用量限额,GPT-6 Luna 是极致性价比档,宣称高 effort 下匹敌上一代 Sol 而成本仅约百分之一;MiMo v2.6 则换了一条赛道,用开放权重覆盖私有化、本地化与高吞吐场景。
维度二:基准成绩的交叉阅读
直接对比要小心:各家自选基准、自选 effort 配置,数字不能横着硬比。更有信息量的是互相引用的部分。
Anthropic 公布的对比里,Terminal-Bench 4.0 上 Opus 5.5 拿 66.4%,GPT-6 Astra 为 57.9%,GPT-5.6 Sol 为 37.3%;FrontierCode v1.1 上 Opus 5.5 以 54.4% 略高于 Astra 的 53.3%,且强调成本约为其五分之一。OpenAI 公布的对比里,AutomationBench 上 GPT-6 Sol(xhigh)拿 33.2%、单任务成本 0.27 美元,Claude Opus 5(max)为 26.9% 但成本是其 11 倍;DeepSWE v1.1 上 GPT-6 Sol(max)68.8%,距 Claude Fable 5 的 69.9% 只差 1.1 个百分点而成本低约 80%。
把双方各自的最强叙事叠起来读,结论反而清晰:在纯能力上,Opus 5.5 与 GPT-6 系列在编码与 agent 任务上互有胜负、差距不大;真正的分水岭在单位成本。这也是为什么两家都在公告里大字强调「以 X 分之一的成本达到同级表现」。MiMo v2.6 的公开数据主打 SWE-Bench Verified 双模式(非 thinking 73.7、thinking 78.6 的量级)与真实工作流的帕累托前沿叙事,建议以其官方文档为准并自行复测。
维度三:effort 调度机制
三家都把「思考多少」做成了显式参数,但设计取向不同:
- Opus 5.5:low、medium(默认)、high、xhigh、max 五档,配合 adaptive thinking。官方客户数据显示低档任务用低档即可:Deloitte 用最低档捕获 72% 的已知 bug 而上代旗舰开高档只有 56%。注意这代不再支持关闭 thinking,低延迟路径要用 low effort 替代。
- GPT-6 Sol / Luna:延续 effort 分档,xhigh 与 max 是官方对比里的常用配置;新增的工程细节很实用——调整 reasoning effort 或工具开关时不破坏缓存,还能显式设置缓存前缀断点,并配套 Prompt Caching Dashboard 做监控。
- MiMo v2.6:提供 thinking 与非 thinking 两种模式,按任务切换,非 thinking 路径天然低延迟。
调度策略上三家的最佳实践高度一致:低档起步、失败升级、按任务价值定档。谁把这套级联做得越细,谁的账单越好看。
维度四:部署形态与生态
Opus 5.5 与 GPT-6 系列都是闭源 API,差别在渠道与功能面:Opus 5.5 同步上线 AWS、Google Cloud、Azure,支持零数据保留,Fast mode 提供 2.5 倍速选项;GPT-6 Sol 与 Luna 即刻进入 ChatGPT Work 与 Codex(Plus 及以上),Luna 还下放给了免费版桌面端,API 模型名分别为 gpt-6-sol 与 gpt-6-luna。
MiMo v2.6 是三者中唯一的开放权重选项,1M token 上下文窗口对混合模态与长文档场景是实打实的差异化,Flash 档主打「以 Pro 级模型的水准处理日常任务、token 效率更优」的定位。对必须私有化、或日均 token 量大到 API 账单失控的团队,开放权重的边际成本优势无可替代;代价是要自建推理优化与运维能力。
选型建议
给一个按场景的速查:交互式编程与 agent 工作流,Opus 5.5 与 GPT-6 Sol 都是一线选择,前者编码基准略占优且缓存更便宜,后者价格减半且 ChatGPT 生态联动更强;海量高并发的简单任务,GPT-6 Luna 的百分之一成本几乎没有对手,适合做路由层的第一跳;私有化与数据主权,MiMo v2.6 开放权重是唯一解,1M 上下文是加分项;混合架构则是多数团队的终局——用低档模型处理八成流量,高档模型兜底长尾难题,路由规则用真实回归集持续校准。
算一笔直觉账可以更具体。假设一个日均处理 5000 万输入 token、1000 万输出 token 的文档处理服务:全量走 Opus 5.5 每天是输入 200 美元加输出 200 美元的量级;若八成流量路由到 GPT-6 Luna,这部分每天只要约 9 美元,剩余两成难题留给高档模型,账单可以压到原来的三分之一以下,而质量曲线由回归集守住。同样的架构在私有化场景里换成 MiMo Flash 打底、API 高档兜底,还能再省掉云侧的溢价,代价是养一个推理运维团队。
最后提醒一句:这一轮三家公告里的对比数字都经过精心选择,任何「谁碾压谁」的结论都站不住。把各家自报的数据当线索,把自己业务上的回归集当法官,才是这批「旗舰能力下沉」发布真正的正确打开方式。