Fable 5解禁,Anthropic同步發Sonnet 5模型搶人
Anthropic回應Fable 5解禁
01 基准測試全面跳漲,壹項評估直接反超Opus
Anthropic公布了伍項主要評估成績,Sonnet 5在所有項目上均較前代Sonnet 4.6有明顯提升。

Sonnet 5在伍項主要評估中縮小了與旗艦模型Opus的差距,並在其中壹項上實現反超
在智能體編碼基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6為58.1%,Opus 4.8為69.2%。差距從前代的11.1個百分點縮小到6個百分點。
在Terminal-Bench 2.1編碼評估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8為82.7%。這項評估上Sonnet 5較前代提升了13.4個百分點,與Opus 4.8的差距只剩2.3個百分點。
多學科推理方面,評估用的是Humanity‘s Last Exam。Anthropic在此次發布中更新了這項考試評分模型,並將Sonnet 4.6的得分修正為34.6%(無工具)和46.8%(有工具),與Sonnet 4.6發布博客中報告的數字不同。
Sonnet 5在無工具條件下得分43.2%,有工具輔助下得分57.4%。有工具時57.4%的成績與Opus 4.8的57.9%基本持平,差距僅0.5個百分點。
計算機使用評估OSWorld-Verified,Anthropic同樣調整了評估方式,使其更准確反映模型在真實世界中的表現。Sonnet 4.6的得分由此更新為78.5%。Sonnet 5的得分是81.2%,提升了2.7個百分點。

在計算機使用任務上,Sonnet 5以更低的單任務成本,接近了Opus 4.8的准確度
知識工作基准測試GDPval-AA v2是Sonnet 5唯壹直接超過Opus 4.8的項目。Sonnet 5得分1618分,Sonnet 4.6為1395分,Opus 4.8為1615分。
Anthropic在官方博客中表示,從這些評估結果來看,Sonnet 5的進步幅度很大,性能已經躍升到了與Opus 4.8大幅重疊的層級。
02 未進行特殊安全訓練
Anthropic在部署前安全評估中對Sonnet 5做了多項測試,結論是相比Sonnet 4.6整體有所改進。
在智能體安全方面,Sonnet 5更擅長拒絕惡意請求,抵抗提示注入攻擊劫持的能力也更強。出現幻覺和諂媚行為的比率較Sonnet 4.6更低。在自動化行為審計中,測試范圍覆蓋了配合濫用、欺騙等廣泛的不當行為,Sonnet 5的總體得分低於Sonnet 4.6,即不當行為發生率更低,更安全。

[物價飛漲的時候 這樣省錢購物很爽]
還沒人說話啊,我想來說幾句
01 基准測試全面跳漲,壹項評估直接反超Opus
Anthropic公布了伍項主要評估成績,Sonnet 5在所有項目上均較前代Sonnet 4.6有明顯提升。

Sonnet 5在伍項主要評估中縮小了與旗艦模型Opus的差距,並在其中壹項上實現反超
在智能體編碼基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6為58.1%,Opus 4.8為69.2%。差距從前代的11.1個百分點縮小到6個百分點。
在Terminal-Bench 2.1編碼評估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8為82.7%。這項評估上Sonnet 5較前代提升了13.4個百分點,與Opus 4.8的差距只剩2.3個百分點。
多學科推理方面,評估用的是Humanity‘s Last Exam。Anthropic在此次發布中更新了這項考試評分模型,並將Sonnet 4.6的得分修正為34.6%(無工具)和46.8%(有工具),與Sonnet 4.6發布博客中報告的數字不同。
Sonnet 5在無工具條件下得分43.2%,有工具輔助下得分57.4%。有工具時57.4%的成績與Opus 4.8的57.9%基本持平,差距僅0.5個百分點。
計算機使用評估OSWorld-Verified,Anthropic同樣調整了評估方式,使其更准確反映模型在真實世界中的表現。Sonnet 4.6的得分由此更新為78.5%。Sonnet 5的得分是81.2%,提升了2.7個百分點。

在計算機使用任務上,Sonnet 5以更低的單任務成本,接近了Opus 4.8的准確度
知識工作基准測試GDPval-AA v2是Sonnet 5唯壹直接超過Opus 4.8的項目。Sonnet 5得分1618分,Sonnet 4.6為1395分,Opus 4.8為1615分。
Anthropic在官方博客中表示,從這些評估結果來看,Sonnet 5的進步幅度很大,性能已經躍升到了與Opus 4.8大幅重疊的層級。
02 未進行特殊安全訓練
Anthropic在部署前安全評估中對Sonnet 5做了多項測試,結論是相比Sonnet 4.6整體有所改進。
在智能體安全方面,Sonnet 5更擅長拒絕惡意請求,抵抗提示注入攻擊劫持的能力也更強。出現幻覺和諂媚行為的比率較Sonnet 4.6更低。在自動化行為審計中,測試范圍覆蓋了配合濫用、欺騙等廣泛的不當行為,Sonnet 5的總體得分低於Sonnet 4.6,即不當行為發生率更低,更安全。

[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
網友:中國大模型何時達到Fable級別?馬斯克回復了 |
智譜等中國大模型何時達到Fable級別水平? |
從發布到"被消失" Fable 5的72小時 |
Anthropic深夜發布Claude Fable 5 屠榜所有測試 |
新鮮百分百 溫村Fable試吃體驗 (2條評論) |
推薦:
Fable 5解禁,Anthropic同步發Sonnet 5模型搶人