OpenAI发布GPT-5.6 Sol,三级定价超越Claude

iEXExchanger
OpenAI发布GPT-5.6 Sol,三级定价超越Claude

OpenAI发布GPT-5.6三级模型:Sol超越Claude Mythos 5编程测试,Terra以一半价格达同等水平,经三周美国政府审核后正式公开。

6月下旬,白宫要求OpenAI暂缓GPT-5.6的公开发布,理由是需要更多时间评估安全风险。三周后的7月9日,美国商务部正式批准——新模型系列向公众开放。

GPT-5.6分为三个层级:Sol(旗舰)、Terra(均衡)和Luna(低成本)。Sol Ultra在代理编程基准TerminalBench 2.1上得分91.91%,基础Sol达到88.76%,超越Claude Mythos 5(88%)和上一代GPT-5.5(83.4%)。Terra得分84.27%,与Claude Fable 5持平,但定价仅为Sol的一半:每百万token输入2.5美元、输出15美元,Sol则为5美元/30美元。Luna最为经济实惠,1美元/6美元,适合高频批量请求。

最重要的新功能是ultra模式:多个子智能体并行处理任务,而非单一模型逐步推进,适用于以往需要手动编排的复杂项目。提示词缓存也同步更新,最短缓存时间30分钟,写入系数1.25倍。

在Cerebras基础设施上,Sol速度最高可达每秒750个token,但快速模式收费较高:每百万token为12.5美元/75美元,目前仅向部分客户开放。

AI旗舰市场竞争前所未有地激烈。Grok 4.5昨日刚刚发布,Claude Mythos 5是当前参照标准,GPT-5.6 Sol仅领先不到一个百分点。对开发者而言,这是最理想的局面:价格持续下降,选择模型越来越取决于具体用途,而非绝对性能优势。

问答

本文相关常见问题

GPT-5.6的Sol、Terra和Luna有什么区别?

Sol(5美元/30美元每百万token)是旗舰,专为复杂编程和代理任务设计。Terra(2.5美元/15美元)性能与GPT-5.5相当,价格为Sol的一半。Luna(1美元/6美元)适合大量低成本请求。

GPT-5.6 Sol与Claude Mythos 5和Grok 4.5相比如何?

在TerminalBench 2.1上,Sol得分88.76%,Claude Mythos 5为88.0%,差距极小。Grok 4.5于前一天发布,定位相似。三款模型在代理编程测试中相差不到1个百分点。

为什么GPT-5.6的公开发布推迟了三周?

6月下旬,白宫要求OpenAI进行额外安全审查,担忧模型在网络安全方面的潜在风险。OpenAI与政府机构合作后,美国商务部最终批准了公开发布。

GPT-5.6的ultra模式是什么?

Ultra模式使用多个子智能体并行处理任务,而非单个代理逐步推进。适用于大型、多步骤项目,可获得单代理模式无法实现的性能提升。