Fable 5解禁,Anthropic同步发Sonnet 5模型抢人
Anthropic回应Fable 5解禁
01 基准测试全面跳涨,一项评估直接反超Opus
Anthropic公布了五项主要评估成绩,Sonnet 5在所有项目上均较前代Sonnet 4.6有明显提升。

Sonnet 5在五项主要评估中缩小了与旗舰模型Opus的差距,并在其中一项上实现反超
在智能体编码基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6为58.1%,Opus 4.8为69.2%。差距从前代的11.1个百分点缩小到6个百分点。
在Terminal-Bench 2.1编码评估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8为82.7%。这项评估上Sonnet 5较前代提升了13.4个百分点,与Opus 4.8的差距只剩2.3个百分点。
多学科推理方面,评估用的是Humanity‘s Last Exam。Anthropic在此次发布中更新了这项考试评分模型,并将Sonnet 4.6的得分修正为34.6%(无工具)和46.8%(有工具),与Sonnet 4.6发布博客中报告的数字不同。
Sonnet 5在无工具条件下得分43.2%,有工具辅助下得分57.4%。有工具时57.4%的成绩与Opus 4.8的57.9%基本持平,差距仅0.5个百分点。
计算机使用评估OSWorld-Verified,Anthropic同样调整了评估方式,使其更准确反映模型在真实世界中的表现。Sonnet 4.6的得分由此更新为78.5%。Sonnet 5的得分是81.2%,提升了2.7个百分点。

在计算机使用任务上,Sonnet 5以更低的单任务成本,接近了Opus 4.8的准确度
知识工作基准测试GDPval-AA v2是Sonnet 5唯一直接超过Opus 4.8的项目。Sonnet 5得分1618分,Sonnet 4.6为1395分,Opus 4.8为1615分。
Anthropic在官方博客中表示,从这些评估结果来看,Sonnet 5的进步幅度很大,性能已经跃升到了与Opus 4.8大幅重叠的层级。
02 未进行特殊安全训练
Anthropic在部署前安全评估中对Sonnet 5做了多项测试,结论是相比Sonnet 4.6整体有所改进。
在智能体安全方面,Sonnet 5更擅长拒绝恶意请求,抵抗提示注入攻击劫持的能力也更强。出现幻觉和谄媚行为的比率较Sonnet 4.6更低。在自动化行为审计中,测试范围覆盖了配合滥用、欺骗等广泛的不当行为,Sonnet 5的总体得分低于Sonnet 4.6,即不当行为发生率更低,更安全。

[加西网正招聘多名全职sales 待遇优]
无评论不新闻,发表一下您的意见吧
01 基准测试全面跳涨,一项评估直接反超Opus
Anthropic公布了五项主要评估成绩,Sonnet 5在所有项目上均较前代Sonnet 4.6有明显提升。

Sonnet 5在五项主要评估中缩小了与旗舰模型Opus的差距,并在其中一项上实现反超
在智能体编码基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6为58.1%,Opus 4.8为69.2%。差距从前代的11.1个百分点缩小到6个百分点。
在Terminal-Bench 2.1编码评估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8为82.7%。这项评估上Sonnet 5较前代提升了13.4个百分点,与Opus 4.8的差距只剩2.3个百分点。
多学科推理方面,评估用的是Humanity‘s Last Exam。Anthropic在此次发布中更新了这项考试评分模型,并将Sonnet 4.6的得分修正为34.6%(无工具)和46.8%(有工具),与Sonnet 4.6发布博客中报告的数字不同。
Sonnet 5在无工具条件下得分43.2%,有工具辅助下得分57.4%。有工具时57.4%的成绩与Opus 4.8的57.9%基本持平,差距仅0.5个百分点。
计算机使用评估OSWorld-Verified,Anthropic同样调整了评估方式,使其更准确反映模型在真实世界中的表现。Sonnet 4.6的得分由此更新为78.5%。Sonnet 5的得分是81.2%,提升了2.7个百分点。

在计算机使用任务上,Sonnet 5以更低的单任务成本,接近了Opus 4.8的准确度
知识工作基准测试GDPval-AA v2是Sonnet 5唯一直接超过Opus 4.8的项目。Sonnet 5得分1618分,Sonnet 4.6为1395分,Opus 4.8为1615分。
Anthropic在官方博客中表示,从这些评估结果来看,Sonnet 5的进步幅度很大,性能已经跃升到了与Opus 4.8大幅重叠的层级。
02 未进行特殊安全训练
Anthropic在部署前安全评估中对Sonnet 5做了多项测试,结论是相比Sonnet 4.6整体有所改进。
在智能体安全方面,Sonnet 5更擅长拒绝恶意请求,抵抗提示注入攻击劫持的能力也更强。出现幻觉和谄媚行为的比率较Sonnet 4.6更低。在自动化行为审计中,测试范围覆盖了配合滥用、欺骗等广泛的不当行为,Sonnet 5的总体得分低于Sonnet 4.6,即不当行为发生率更低,更安全。

[加西网正招聘多名全职sales 待遇优]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
网友:中国大模型何时达到Fable级别?马斯克回复了 |
智谱等中国大模型何时达到Fable级别水平? |
从发布到"被消失" Fable 5的72小时 |
Anthropic深夜发布Claude Fable 5 屠榜所有测试 |
新鲜百分百 温村Fable试吃体验 (2条评论) |
推荐:
Fable 5解禁,Anthropic同步发Sonnet 5模型抢人