Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
Fable 5解禁,Anthropic同步發Sonnet 5模型搶人 | 溫哥華教育中心
   

Fable 5解禁,Anthropic同步發Sonnet 5模型搶人

Anthropic回應Fable 5解禁


01 基准測試全面跳漲,壹項評估直接反超Opus

Anthropic公布了伍項主要評估成績,Sonnet 5在所有項目上均較前代Sonnet 4.6有明顯提升。



Sonnet 5在伍項主要評估中縮小了與旗艦模型Opus的差距,並在其中壹項上實現反超

在智能體編碼基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6為58.1%,Opus 4.8為69.2%。差距從前代的11.1個百分點縮小到6個百分點。

在Terminal-Bench 2.1編碼評估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8為82.7%。這項評估上Sonnet 5較前代提升了13.4個百分點,與Opus 4.8的差距只剩2.3個百分點。

多學科推理方面,評估用的是Humanity‘s Last Exam。Anthropic在此次發布中更新了這項考試評分模型,並將Sonnet 4.6的得分修正為34.6%(無工具)和46.8%(有工具),與Sonnet 4.6發布博客中報告的數字不同。

Sonnet 5在無工具條件下得分43.2%,有工具輔助下得分57.4%。有工具時57.4%的成績與Opus 4.8的57.9%基本持平,差距僅0.5個百分點。

計算機使用評估OSWorld-Verified,Anthropic同樣調整了評估方式,使其更准確反映模型在真實世界中的表現。Sonnet 4.6的得分由此更新為78.5%。Sonnet 5的得分是81.2%,提升了2.7個百分點。



在計算機使用任務上,Sonnet 5以更低的單任務成本,接近了Opus 4.8的准確度


知識工作基准測試GDPval-AA v2是Sonnet 5唯壹直接超過Opus 4.8的項目。Sonnet 5得分1618分,Sonnet 4.6為1395分,Opus 4.8為1615分。

Anthropic在官方博客中表示,從這些評估結果來看,Sonnet 5的進步幅度很大,性能已經躍升到了與Opus 4.8大幅重疊的層級。

02 未進行特殊安全訓練

Anthropic在部署前安全評估中對Sonnet 5做了多項測試,結論是相比Sonnet 4.6整體有所改進。

在智能體安全方面,Sonnet 5更擅長拒絕惡意請求,抵抗提示注入攻擊劫持的能力也更強。出現幻覺和諂媚行為的比率較Sonnet 4.6更低。在自動化行為審計中,測試范圍覆蓋了配合濫用、欺騙等廣泛的不當行為,Sonnet 5的總體得分低於Sonnet 4.6,即不當行為發生率更低,更安全。



[物價飛漲的時候 這樣省錢購物很爽]
還沒人說話啊,我想來說幾句
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  • 在此頁閱讀全文
     延伸閱讀
    網友:中國大模型何時達到Fable級別?馬斯克回復了 智譜等中國大模型何時達到Fable級別水平?
    從發布到"被消失" Fable 5的72小時 Anthropic深夜發布Claude Fable 5 屠榜所有測試
    新鮮百分百 溫村Fable試吃體驗  (2條評論)  
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站