9月28日,Anthropic发布了Claude Sonnet 5.5——距离旗舰模型Opus 5.5上线还不到一周,这已是5.5系列的第二款产品。乍看只是普通的版本迭代,但数据值得关注:同样的任务现在提速30%,成本最多下降三成,而每个代币的价格完全没变。
秘密不在定价——输入代币仍是每百万2美元,输出代币10美元,与Sonnet 5完全一致。省下的钱来自模型完成同样结果所需的步骤、代币和工具调用更少。早期用户的数据也印证了这一点:Slack反馈每个任务输出代币减少14%,Zendesk提速20%,Box的处理速度提升2.4倍,代币消耗还降低了12%。
基准测试的差距比上面的百分比更惊人。Terminal-Bench 4.0的得分从Sonnet 5时代的10.3%跃升至70.6%,接近七倍。在GDPval-AA v2.1测试中,Sonnet 5.5拿下1844分,仅比价格更贵的旗舰Opus 5.5(1846分)低了2分,差距几乎消失。还有个有趣的细节:Sonnet 5.5是该系列首个仅凭游戏截图就通关《精灵宝可梦:红》的模型。
Anthropic的产品分工逻辑没变:需要长时间推理和细致判断的复杂任务交给Opus 5.5,而修复代码、撰写文档、制作表格和幻灯片这类目标明确的日常工作则交给Sonnet 5.5。新模型已经在Anthropic API、AWS、谷歌云和微软Azure上线,型号代号为claude-sonnet-5-5;更新版Haiku据称将在"未来几周"跟进,但尚未公布具体日期。
Anthropic也坦承了一个代价:Sonnet首次获得了此前只有Opus和Fable才有的网络安全限制,公司承认这可能导致模型在一些本身无害的安全任务上拒绝作答。就在上周OpenAI刚刚下调了GPT-5.6的价格,如今AI实验室之间的较量,重心明显已经从"谁更聪明"转向了"谁能用更低成本干同样的活"。



