OpenAI"杀死了"Codex,一个超级应用诞生
GPT-5.6 Sol在Agent's Last Exam中以53.6分领先Claude Fable 5 13.1分
在衡量智能与速度的Artificial Analysis Index榜单上,Sol在最大推理设置下的智力表现与Fable 5几乎持平,但任务耗时暴跌61%,成本直接砍半。

GPT-5.6 Sol(最大推理)智能与Fable 5几乎持平,耗时少61%,成本约低一半
在编程攻坚上,Sol在Coding Agent Index上以80分创下新纪录,超过Fable 5,且输出token和耗时全部减半,成本仅需三分之一。

GPT-5.6 Sol得分80,超越Fable 5(2.8分),且token、耗时、成本均大幅降低
此外,在桌面操作测试OSWorld 2.0、网安攻防测试SEC-Bench Pro中,GPT-5.6的表现同样亮眼,同时token消耗大幅下降。
这种效率的飞跃,源于模型可在内存中自编自运行轻量程序,实现工具协调和数据自滤。配合Responses API中的“程序化工具调用”,开发者无需再机械地为每一步写脚本。
针对地狱级难度的任务,GPT-5.6还提供了两套越级配置:Max模式愿意砸入算力与时间,进行深度推理、多方案探索与疯狂自检;Ultra模式则直接开启多智能体并联,默认4个、最高可拉满16个智能体死磕同一任务。
几位科技圈大咖在提前测试GPT-5.6后,给出了最直观的评测体验:
宾夕法尼亚大学沃顿商学院的伊桑·莫里克(Ethan Mollick)认为:“Sol适合那种需要反复拉扯、连我自己都没完全想明白需求的任务;而Fable则适合那些定义非常明确的长任务。”

知名投资人马特·舒默(Matt Shumer)的感受更直接,他解释称:“Fable有股‘初代大模型’的厚重味,而GPT-5.6感觉像是经过极致强化学习调优的精干模型。绝配组合是:让Fable写代码,让GPT-5.6来当审计员,后者在安全工作上主动性极强。”
[加西网正招聘多名全职sales 待遇优]
好新闻没人评论怎么行,我来说几句
在衡量智能与速度的Artificial Analysis Index榜单上,Sol在最大推理设置下的智力表现与Fable 5几乎持平,但任务耗时暴跌61%,成本直接砍半。

GPT-5.6 Sol(最大推理)智能与Fable 5几乎持平,耗时少61%,成本约低一半
在编程攻坚上,Sol在Coding Agent Index上以80分创下新纪录,超过Fable 5,且输出token和耗时全部减半,成本仅需三分之一。

GPT-5.6 Sol得分80,超越Fable 5(2.8分),且token、耗时、成本均大幅降低
此外,在桌面操作测试OSWorld 2.0、网安攻防测试SEC-Bench Pro中,GPT-5.6的表现同样亮眼,同时token消耗大幅下降。
这种效率的飞跃,源于模型可在内存中自编自运行轻量程序,实现工具协调和数据自滤。配合Responses API中的“程序化工具调用”,开发者无需再机械地为每一步写脚本。
针对地狱级难度的任务,GPT-5.6还提供了两套越级配置:Max模式愿意砸入算力与时间,进行深度推理、多方案探索与疯狂自检;Ultra模式则直接开启多智能体并联,默认4个、最高可拉满16个智能体死磕同一任务。
几位科技圈大咖在提前测试GPT-5.6后,给出了最直观的评测体验:
宾夕法尼亚大学沃顿商学院的伊桑·莫里克(Ethan Mollick)认为:“Sol适合那种需要反复拉扯、连我自己都没完全想明白需求的任务;而Fable则适合那些定义非常明确的长任务。”

知名投资人马特·舒默(Matt Shumer)的感受更直接,他解释称:“Fable有股‘初代大模型’的厚重味,而GPT-5.6感觉像是经过极致强化学习调优的精干模型。绝配组合是:让Fable写代码,让GPT-5.6来当审计员,后者在安全工作上主动性极强。”
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
推荐:
OpenAI"杀死了"Codex,一个超级应用诞生