Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
Anthropic宣布:Claude自己長出了意識 | 溫哥華教育中心
   

Anthropic宣布:Claude自己長出了意識

結果有點出乎意料……Claude 幾乎沒事。


說話依然流利,情感分類、選擇題、從文章裡找事實,都跟原來差不多。

但變差了的是另壹類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比壹個小得多的完整模型還差。

博客裡還有個很是微妙的對照實驗:

給 Claude 看壹段西班牙語文章,然後在 J-space 裡把「Spanish」換成「French」。問它這是什麼語言,它答法語;問它壹位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。

但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。



西班牙語換法語

同壹份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說壹整天話,全程不想壹次語法。

這跟人類認知裡「深思熟慮 vs 自動加工」的分野,幾乎是壹個模子。

07

識破敲詐評測

好了,說點實用的、和你感興趣的。

AI 安全的壹個核心困境是:我們通常只能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,壹部分隱藏思維可以直接讀了。

第壹個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。


而把 J-lens 架上去壹讀:在 Claude 還沒寫下任何字之前,它的 J-space 裡就已經亮著「fake」和「fictional」。

它早就看出來這場戲是演的。



敲詐場景的 J-lens 讀數

隨後還能看著它的評估壹步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。

這就引出壹個所有做 AI 評測的人都躲不開的問題:模型在道德測試裡表現良好,有多少是因為它懷疑自己正在被測試呢?

Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同壹個場景。

[物價飛漲的時候 這樣省錢購物很爽]
還沒人說話啊,我想來說幾句
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  • 在此頁閱讀全文
     延伸閱讀
    超微將投資Anthropic多達50億美元 挑戰輝達AI霸權 AI怎樣"想"出答案?Anthropic找到了線索
    挑戰OpenAI與Anthropic 馬斯克發布Grok 4.5 FT:為什麼OpenAI和Anthropic可能難以維持運營
    "中國版Anthropic"這個說法很流行,但並不存在 被控模型蒸餾 阿裡巴巴據報禁用Anthropic工具
    半導體股票暴跌,Anthropic卻想造壹顆2nm芯片 Fable 5解禁,Anthropic同步發Sonnet 5模型搶人
    美國解除大模型管制,Anthropic恢復訪問 特朗普瘋狂打壓Anthropic 奧地利鼓動歐盟"挖牆腳"
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站