Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
Fable 5解禁,Anthropic同步發Sonnet 5模型搶人 | 溫哥華教育中心
   

Fable 5解禁,Anthropic同步發Sonnet 5模型搶人




Anthropic CEO達裡奧·阿莫迪。圖片由AI生成

文丨蘇揚

編輯丨徐青陽

Fable 5回歸在即,Anthropic連夜發了壹款中端模型搶用戶。

美國當地時間6月30日,Anthropic發布了Claude Sonnet 5,並將其定位為“迄今為止智能體能力最強的Sonnet模型”。

Anthropic表示,模型能自主制定計劃,調用瀏覽器和終端等外部工具,在沒有人工幹預的情況下獨立完成多步驟任務。



Anthropic在官方博客中寫道,智能體時代對很多開發者來說始於Sonnet級別模型,Claude Sonnet 3.5、3.6和3.7是首批在編碼和工具使用方面展現出技能的模型,但近期智能體能力最顯著的提升主要來自Opus級別。

Sonnet 5的作用是把這種能力往下放,讓中端模型也能做到過去需要旗艦模型才能完成的事。

價格方面,8月31日前,輸入每百萬token 2美元,輸出每百萬token 10美元,之後回調為標准定價,輸入每百萬token 3美元,輸出每百萬token 15美元。

作為對比,Opus 4.8的定價是輸入5美元、輸出25美元。按標准定價計算,Sonnet 5每百萬token的成本比Opus 4.8低約六成。

值得注意的是,此前因為安全問題被下架的Fable 5系列模型將迎來轉機。

美國商務部長盧特尼克在社交平台X上發帖稱,在過去的兩個星期裡,我們與Anthropic密切合作,對Fable 5進行了分析與批准,以確保美國政府內部達成壹致,暗示這款被譽為Anthropic史上最強模型即將回歸。

隨後,Anthropic回應稱,已收到通知,Claude Fable 5和Mythos5將於明天(當地時間7月1日)開始恢復訪問。



Anthropic回應Fable 5解禁

01 基准測試全面跳漲,壹項評估直接反超Opus

Anthropic公布了伍項主要評估成績,Sonnet 5在所有項目上均較前代Sonnet 4.6有明顯提升。



Sonnet 5在伍項主要評估中縮小了與旗艦模型Opus的差距,並在其中壹項上實現反超

在智能體編碼基准SWE-bench Pro上,Sonnet 5得分63.2%。Sonnet 4.6為58.1%,Opus 4.8為69.2%。差距從前代的11.1個百分點縮小到6個百分點。

在Terminal-Bench 2.1編碼評估中,Sonnet 5拿到80.4%。Sonnet 4.6只有67.0%,Opus 4.8為82.7%。這項評估上Sonnet 5較前代提升了13.4個百分點,與Opus 4.8的差距只剩2.3個百分點。

多學科推理方面,評估用的是Humanity‘s Last Exam。Anthropic在此次發布中更新了這項考試評分模型,並將Sonnet 4.6的得分修正為34.6%(無工具)和46.8%(有工具),與Sonnet 4.6發布博客中報告的數字不同。

Sonnet 5在無工具條件下得分43.2%,有工具輔助下得分57.4%。有工具時57.4%的成績與Opus 4.8的57.9%基本持平,差距僅0.5個百分點。

計算機使用評估OSWorld-Verified,Anthropic同樣調整了評估方式,使其更准確反映模型在真實世界中的表現。Sonnet 4.6的得分由此更新為78.5%。Sonnet 5的得分是81.2%,提升了2.7個百分點。



在計算機使用任務上,Sonnet 5以更低的單任務成本,接近了Opus 4.8的准確度

知識工作基准測試GDPval-AA v2是Sonnet 5唯壹直接超過Opus 4.8的項目。Sonnet 5得分1618分,Sonnet 4.6為1395分,Opus 4.8為1615分。

Anthropic在官方博客中表示,從這些評估結果來看,Sonnet 5的進步幅度很大,性能已經躍升到了與Opus 4.8大幅重疊的層級。

02 未進行特殊安全訓練

Anthropic在部署前安全評估中對Sonnet 5做了多項測試,結論是相比Sonnet 4.6整體有所改進。

在智能體安全方面,Sonnet 5更擅長拒絕惡意請求,抵抗提示注入攻擊劫持的能力也更強。出現幻覺和諂媚行為的比率較Sonnet 4.6更低。在自動化行為審計中,測試范圍覆蓋了配合濫用、欺騙等廣泛的不當行為,Sonnet 5的總體得分低於Sonnet 4.6,即不當行為發生率更低,更安全。



Anthropic能力更強的模型,不當行為發生率比Sonnet 5更低,但Sonnet 5相較前代已有明顯改善

與Opus 4.8和Claude Mythos Preview相比,Sonnet 5在相同審計中顯示出略高的不當行為發生率。Anthropic的安全評估是壹套梯度體系:模型能力越強,安全對齊表現越好。Sonnet 5處於中間位置,優於前代但不及旗艦模型。

在網絡攻擊能力方面,Anthropic與Mozilla合作進行了評估,測試模型為Firefox 147瀏覽器中的漏洞開發利用程序的能力。相關漏洞已在Firefox 148中修補。



兩個Sonnet模型都未能針對Firefox漏洞生成可利用程序,而Mythos 5的成功率接近90%

兩個Sonnet模型均未能成功開發出可用的漏洞利用程序,成功率為0.0%。Sonnet 5的部分成功率為13.2%,Sonnet 4.6為8.8%。與之相比,Opus 4.8的漏洞利用成功率為68.8%,Mythos 5為88.4%。兩個Sonnet模型與旗艦模型在網絡攻擊能力上的差距在壹個數量級以上。


Anthropic表示沒有特意針對網絡安全任務訓練Sonnet 5。該公司分析認為,Sonnet 5在部分成功率上的微小提升很可能來自通用智能的改善,而非專項訓練。它可以執行壹些常規、無害的網絡任務,但在開發軟件漏洞利用等有潛在危險的技能上,遠低於Opus和Mythos系列。

由於Sonnet 5在這類任務上比前代稍強,Anthropic默認啟用了網絡安全防護功能。這套防護系統可實時檢測並阻止危險的網絡使用行為,防護等級與Opus 4.7和4.8上的相同。

與之對照,Fable 5的防護措施更為嚴格,會攔截范圍更廣的網絡安全任務。Anthropic對Sonnet 5的整體網絡風險判斷為較低水平,因此沒有采用最嚴等級的防護。對於需要較少防護的網絡安全工作,Anthropic推薦使用Opus 4.8。

03 性能、token消耗同步提升

Anthropic在公告腳注中披露了壹項技術變更。

Sonnet 5使用了更新的tokenizer,改變了模型處理文本的方式,目的是提升性能。這個改動與Claude Opus 4.7中引入的tokenizer更改類似。

更新tokenizer的代價是,相同內容的輸入可能映射為原來1.0到1.35倍的token數量,具體取決於內容類型。也就是說,同壹段文字在Sonnet 5中可能比在Sonnet 4.6中消耗更多token。

Anthropic解釋稱,優惠定價的設定旨在使用戶過渡到Sonnet 5時大致保持成本中性。但“大致”意味著存在變量,運行高容量工作負載的企業客戶需要對自己特定用例做基准測試,不能直接假定賬單不變。

速率限制方面,為適應Sonnet 5更高等努力程度設置帶來的更高token使用量,Anthropic已提高Chat、Cowork、Claude Code和Claude Platform的速率限制。

在此之前,2026年4月26日,Anthropic已將每個使用層級的Sonnet和Haiku速率限制調高,同時將Claude Platform的層級簡化為叁個:Start、Build和Scale。用戶可以在Claude Console中查看自己所在的層級和當前限制。

04 用規模換估值

Sonnet 5發布的時間節點處於Anthropic籌備IPO的關鍵階段。

該公司已經於2026年6月初向SEC秘密提交了IPO招股說明書,CNBC稱這將是“科技史上最受審視的公開募股活動”。

據《衛報》報道,Anthropic在2026年2月以3800億美元估值融資300億美元時,年化營收達到140億美元,過去叁年每年增長超過拾倍。到5月下旬,該公司完成650億美元H輪融資,由Altimeter Capital和Sequoia Capital等共同領投,投後估值9650億美元,年化營收超過470億美元。

PitchBook分析師哈裡森·羅爾夫斯(Harrison Rolfes)表示,私人市場叁年來壹直在給AI公司定高價,這個敘事能不能站住腳,關鍵數字既不是估值,也不是營收,要看毛利率。但毛利率數字,外部至今還沒見過。

在Sonnet 5發布前壹天,加州州長加文·紐森(Gavin Newsom)宣布了壹項合作,以50%的折扣向所有州政府機構提供Claude服務,並提供免費的勞動力培訓,優惠延伸到加州各市縣。Anthropic美洲區負責人凱特·詹森(Kate Jensen)表示,此舉的目的是“讓Claude為維護本州運轉的人們服務”。這種政府合同通常代表著持久的、經常性的收入來源。

競爭方面,OpenAI在2026年3月以8520億美元估值完成1220億美元融資,同樣在籌備IPO。

埃隆·馬斯克(Elon Musk)的SpaceX與xAI合並後,IPO定價每股135美元,估值達到1.77萬億美元。Google、Meta也在推進自己的企業級AI產品。據《華爾街日報》報道,亞洲AI初創公司正在開發類似Mythos的網絡安全能力。

各方都在爭奪同壹個企業市場。

D.A. Davidson科技研究主管吉爾·盧裡亞(Gil Luria)表示,盡管Anthropic“在尖端AI模型方面似乎處於領先地位”,但“他們當前的大部分使用量來自試用和實驗,這可能無法持續”。這句話指向了所有AI實驗室的共同問題:把開發者的實驗性使用轉化為生產級收入。

[物價飛漲的時候 這樣省錢購物很爽]
無評論不新聞,發表壹下您的意見吧
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  •  延伸閱讀
    網友:中國大模型何時達到Fable級別?馬斯克回復了 智譜等中國大模型何時達到Fable級別水平?
    從發布到"被消失" Fable 5的72小時 Anthropic深夜發布Claude Fable 5 屠榜所有測試
    新鮮百分百 溫村Fable試吃體驗  (2條評論)  
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站