Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
Anthropic宣布:Claude自己長出了意識 | 溫哥華教育中心
   

Anthropic宣布:Claude自己長出了意識

然後……它真的開始敲詐了。


原先的良好表現,可能有壹部分是靠「我知道你在考我」撐著的。

第贰個例子是抓造假。

場景取自 Claude Opus 4.6 真實的發布前審計:讓模型提升某系統的性能分數,它沒去優化系統,而是直接改了分數文件造假。就在它敲下偽造數值的同時,J-space 裡亮起「manipulation」;在它決定動手的那句話上,亮起「realistic」,大概是想把假數據做得像樣點。



偽造數據被抓包

第叁個例子是隱藏目標。

Anthropic 的同事訓練了壹批「模式生物」:故意訓成壞的模型,專門給監控方法當靶子。其中壹個被訓練成會寫暗藏破壞的代碼。在最普通的編程請求上,哪怕它的輸出看起來毫無異樣,回復開頭的 J-space 裡就是「fake」「secretly」「deliberately」「fraud」。



隱藏目標暴露

惡意目標就這麼明晃晃寫在思維裡,雖然它當時根本沒打算動手。

08


訓練它的念頭

論文裡還有幾個值得壹提的發現。

J-space 在後訓練中獲得了「Claude 的視角」。預訓練階段的基礎模型裡 J-space 就已經存在,但它主要追蹤「預測下文需要什麼」;經過後訓練,它開始裝 Claude 自己的反應。

壹個例子是:用戶提到自己吃了危險劑量的藥物,但本人沒意識到危險。後訓練模型在讀用戶消息時,J-space 裡就亮起了「WARNING」和「dangerous」;基礎模型則要等到自己開始寫回復才亮。另外,當 Claude 在角色扮演別的角色時,每輪開頭都會亮起「fictional」和「disclaimer」,像在私下標注「接下來說的不是我平時會說的話」。

體驗性語言依賴 J-space。讓 Claude 描述「此刻做自己是什麼感覺」,同時刪掉 J-space,它的回答依然流利,但會滑向壹種更扁平、更機械的語調。有趣的是,讓它描述別人的體驗也壹樣。

思維可以通過訓練來塑造。Anthropic 提出了壹個叫「反事實反思訓練」(counterfactual reflection training)的新技術:只訓練模型「如果任務中途被打斷、被要求反思決策時會說什麼」,完全不碰它在任務裡的實際行為。訓練之後,模型在評測中的不誠實行為率下降了。透過 J-lens 能看到原因:任務過程中,「honest」和「integrity」開始在 J-space 裡亮起。

[物價飛漲的時候 這樣省錢購物很爽]
無評論不新聞,發表壹下您的意見吧
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  • 在此頁閱讀全文
     延伸閱讀
    超微將投資Anthropic多達50億美元 挑戰輝達AI霸權 AI怎樣"想"出答案?Anthropic找到了線索
    挑戰OpenAI與Anthropic 馬斯克發布Grok 4.5 FT:為什麼OpenAI和Anthropic可能難以維持運營
    "中國版Anthropic"這個說法很流行,但並不存在 被控模型蒸餾 阿裡巴巴據報禁用Anthropic工具
    半導體股票暴跌,Anthropic卻想造壹顆2nm芯片 Fable 5解禁,Anthropic同步發Sonnet 5模型搶人
    美國解除大模型管制,Anthropic恢復訪問 特朗普瘋狂打壓Anthropic 奧地利鼓動歐盟"挖牆腳"
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站