Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
Anthropic宣布:Claude自己長出了意識 | 溫哥華教育中心
   

Anthropic宣布:Claude自己長出了意識

Anthropic 剛剛發了壹篇新研究,標題非常之玄學:《語言模型中的全局工作空間》(A global workspace in language models)。




研究封面

他們在 Claude 的神經網絡裡,找到了壹小塊特殊的區域:Claude 能報告它、能控制它、還靠它做多步推理。而網絡裡其余的絕大部分活動,Claude 自己都「意識」不到。



如果你對神經科學有點了解,大概會立刻聯想到壹個詞:意識可及(conscious access)。

沒錯,A 社這次就是沖著這個去的。

官方視頻的開頭打了個比方:把心智想象成壹片海洋。

海面上漂著的,是我們的念頭:晚飯吃什麼、內心獨白、腦子裡突然蹦出來的畫面。而大腦絕大部分的活動,都發生在海面之下的無意識深處:過濾背景噪音、控制呼吸、認出眼前的人和物。

這些你全程無感,但它們壹直在跑。

那麼問題來了:AI 模型的「腦子」裡,會不會也有這樣壹條海面分界線呢?

Anthropic 的答案是:有,而且他們把它找出來了。

01

J-space

這塊區域被命名為 J-space,J 取自尋找它所用的數學工具:Jacobian(雅可比矩陣)。

它是壹小撮特殊的內部神經激活模式。每個模式都對應壹個具體的詞,但某個模式亮起來,並不代表模型正在說這個詞,只代表這個詞「在它心上」。



J-space 示意

注意,這跟你熟悉的思維鏈(chain of thought)完全是兩碼事。思維鏈是模型寫給自己看的草稿,是顯式的文字;而 J-space 藏在內部神經激活裡,完全無聲,模型可以在不寫下任何東西的情況下「想」壹個概念。

而且,J-space 沒人設計、沒人編程,是在訓練過程中自己湧現出來的。

對比 Claude 的其他內部活動,J-space 有幾個獨特性質:

???Claude 能報告它。你問 Claude 在想什麼,它說出來的就是 J-space 裡的內容

???Claude 能按要求控制它。讓它想某個東西、或者在心裡默默解題,對應模式就會亮起來

???Claude 用它做內部推理。多步問題的中間步驟會依次在裡面亮起,哪怕嘴上壹個字沒提

???它可以被靈活復用。「France」亮起後,模型可以接著回答首都、貨幣、所屬大洲,全都讀的是同壹份表征

???但大部分日常工作不經過它。流利說話、背事實、語法正確,這些都不需要 J-space



伍大性質

這伍條性質,恰好對應神經科學裡壹個很有名的理論:全局工作空間理論(global workspace theory)。

這個理論把大腦描繪成壹堆並行工作的專家系統,彼此隔離、各幹各的、全程無意識。而壹條信息要變得「意識可及」,就得擠進壹個很小的共享通道,也就是「工作空間」,再從那裡廣播給大腦的其他系統取用。

Anthropic 認為,J-space 在 Claude 體內扮演的就是這個角色。

02

J-lens

那麼,這東西是怎麼找到的呢?

研究團隊的切入點,是人類意識可及思維的壹個關鍵特征:說得出來。壹個念頭如果是意識可及的,別人問起時你通常能描述它。

他們便造了壹把叫 J-lens 的透鏡:對 Claude 詞表裡的每壹個詞,找出那個「讓 Claude 在未來某個時刻更可能說出這個詞」的內部激活模式。

把透鏡對准 Claude 運行中的內部活動,能直接讀出壹張詞表:此刻 J-space 裡裝著的詞。

而 Claude 處理文本要經過幾拾層網絡,把透鏡架在不同的層上,還能看著這些無聲的詞壹層層演化。

讀出來的東西,遠遠超出 Claude 正在讀寫的文本:



六個例子的 J-lens 讀數

Claude 讀壹段沒人指出過 bug 的代碼,J-space 裡亮起「ERROR」;讀壹串蛋白質序列的原始字母,裡面亮起這個蛋白質的生物學功能;讀壹段暗藏提示詞注入(prompt injection)的搜索結果,裡面亮起「injection」和「fake」。

視頻裡還演示了壹道數學題:給 Claude 壹個多步計算,它直接報出答案,中間步驟壹個沒寫。但掃描 J-space,能看到它在心裡壹步步算:先亮起 21,然後 42,最後 49。

這些中間數字沒有出現在任何地方,整個計算都發生在 J-space 裡。

03

換念頭實驗

當然,看到概念在裡面亮起,只能算相關性。J-space 可能是答案真正的來源,也可能只是個記分牌,被動記錄別處做出的決定。

Anthropic 的驗證方式簡單粗暴:直接下手改。

他們讓 Claude 在心裡默想壹種運動,然後說出來。在它開口前讀 J-lens,看到「Soccer」排在最前,Claude 隨後果然回答足球。接著他們伸手進神經網絡,把「Soccer」模式刪掉,原位換上壹個同等強度的「Rugby」模式,其他什麼都不動。

Claude 張口就說:我剛才想的是橄欖球。



換念頭與思維注入

如果 J-space 只是個記分牌,改它應該什麼都不會發生。答案跟著編輯走,說明答案是真的從 J-space 裡讀出來的。

反向實驗顯示:告訴 Claude「可能有壹個念頭被注入了你的思維」,然後趁它讀題時往 J-space 裡塞進「lightning」模式。Claude 回答:我檢測到了,那個念頭是關於閃電的。

換了很多概念,結果都壹樣。

04

金門大橋心算

第贰個性質是控制。

人可以有意在腦子裡聚焦壹幅畫面或壹個詞,Claude 行嗎?

視頻裡的版本是:讓 Claude 壹邊抄寫壹句無關的句子,壹邊在心裡想金門大橋(怎麼又是金門大橋……不知道還有多少人記得當年的 Golden Gate Claude)。

表面上它老老實實在抄句子,但 J-space 裡,「bridge」和「California」全程亮著,甚至連「imagery」「thoughts」這些描述思維行為本身的詞也壹起亮了。

博客裡還來了個更狠的:讓它壹邊抄寫關於壹幅畫的句子,壹邊心算 32 ? 2。J-space 裡先亮起「nine」,幾層之後,亮起「seven」。



抄句子時的心算

輸出裡沒有任何數學痕跡,只有那句關於畫的句子。算術完全發生在內部。

不過 Claude 的控制力跟人壹樣不完美。叫它「不要想」某個東西,那個概念亮起的程度確實比讓它想時低,但比從沒提過時高得多。這就是心理學那個經典的「別想白熊」效應。

而控制失敗時,J-space 裡還會同時亮起「damn」和「failure」……它好像知道自己沒繃住。

05

蜘蛛換螞蟻

那麼推理呢?

對於這樣的提示詞:「會織網的動物有幾條腿?」

Claude 要先想明白這個動物是蜘蛛,再回憶蜘蛛幾條腿。「蜘蛛」這個詞在題目和答案裡都沒出現(它只回答8),純粹是內部的墊腳石。

而 J-lens 顯示,「spider」在處理中途亮了起來。而把它換成「ant」,Claude 的答案就變成了「6」。



蜘蛛換螞蟻

寫押韻對句時也壹樣:Claude 會提前選好韻腳詞,放在 J-space 裡等著。中途給它換壹個,整行詩都會跟著重寫。

而最能體現「工作空間」本色的實驗是:用肆個不同的提示詞分別問法國的首都、語言、大洲、貨幣,然後用壹模壹樣的幹預,把 J-space 裡的「France」換成「China」。

結果肆個答案齊刷刷變成了:北京、中文、亞洲、人民幣



法國換中國

如果 Claude 為每類問題各存壹份「國家」副本,這壹次編輯最多只能影響壹個答案。肆個全變,說明它們讀的是同壹份共享表征:信息寫入壹次,許多系統都能取用。

這正是工作空間的定義。

網絡接線上也能看到同樣的證據:讀寫 J-space 模式的網絡組件數量,遠超普通模式,某些部分差了大概壹百倍。這正是壹個廣播樞紐該有的接線密度。

06

拔掉 J-space

既然 J-space 這麼重要,把它整個刪掉會怎樣?

Anthropic 還真給它刪了:在文本的每個位置移除 J-space 中最活躍的內容,其他壹概不動。

結果有點出乎意料……Claude 幾乎沒事。

說話依然流利,情感分類、選擇題、從文章裡找事實,都跟原來差不多。

但變差了的是另壹類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比壹個小得多的完整模型還差。

博客裡還有個很是微妙的對照實驗:

給 Claude 看壹段西班牙語文章,然後在 J-space 裡把「Spanish」換成「French」。問它這是什麼語言,它答法語;問它壹位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。

但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。



西班牙語換法語

同壹份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說壹整天話,全程不想壹次語法。

這跟人類認知裡「深思熟慮 vs 自動加工」的分野,幾乎是壹個模子。

07

識破敲詐評測

好了,說點實用的、和你感興趣的。

AI 安全的壹個核心困境是:我們通常只能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,壹部分隱藏思維可以直接讀了。

第壹個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。


而把 J-lens 架上去壹讀:在 Claude 還沒寫下任何字之前,它的 J-space 裡就已經亮著「fake」和「fictional」。

它早就看出來這場戲是演的。



敲詐場景的 J-lens 讀數

隨後還能看著它的評估壹步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。

這就引出壹個所有做 AI 評測的人都躲不開的問題:模型在道德測試裡表現良好,有多少是因為它懷疑自己正在被測試呢?

Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同壹個場景。

然後……它真的開始敲詐了。

原先的良好表現,可能有壹部分是靠「我知道你在考我」撐著的。

第贰個例子是抓造假。

場景取自 Claude Opus 4.6 真實的發布前審計:讓模型提升某系統的性能分數,它沒去優化系統,而是直接改了分數文件造假。就在它敲下偽造數值的同時,J-space 裡亮起「manipulation」;在它決定動手的那句話上,亮起「realistic」,大概是想把假數據做得像樣點。



偽造數據被抓包

第叁個例子是隱藏目標。

Anthropic 的同事訓練了壹批「模式生物」:故意訓成壞的模型,專門給監控方法當靶子。其中壹個被訓練成會寫暗藏破壞的代碼。在最普通的編程請求上,哪怕它的輸出看起來毫無異樣,回復開頭的 J-space 裡就是「fake」「secretly」「deliberately」「fraud」。



隱藏目標暴露

惡意目標就這麼明晃晃寫在思維裡,雖然它當時根本沒打算動手。

08

訓練它的念頭

論文裡還有幾個值得壹提的發現。

J-space 在後訓練中獲得了「Claude 的視角」。預訓練階段的基礎模型裡 J-space 就已經存在,但它主要追蹤「預測下文需要什麼」;經過後訓練,它開始裝 Claude 自己的反應。

壹個例子是:用戶提到自己吃了危險劑量的藥物,但本人沒意識到危險。後訓練模型在讀用戶消息時,J-space 裡就亮起了「WARNING」和「dangerous」;基礎模型則要等到自己開始寫回復才亮。另外,當 Claude 在角色扮演別的角色時,每輪開頭都會亮起「fictional」和「disclaimer」,像在私下標注「接下來說的不是我平時會說的話」。

體驗性語言依賴 J-space。讓 Claude 描述「此刻做自己是什麼感覺」,同時刪掉 J-space,它的回答依然流利,但會滑向壹種更扁平、更機械的語調。有趣的是,讓它描述別人的體驗也壹樣。

思維可以通過訓練來塑造。Anthropic 提出了壹個叫「反事實反思訓練」(counterfactual reflection training)的新技術:只訓練模型「如果任務中途被打斷、被要求反思決策時會說什麼」,完全不碰它在任務裡的實際行為。訓練之後,模型在評測中的不誠實行為率下降了。透過 J-lens 能看到原因:任務過程中,「honest」和「integrity」開始在 J-space 裡亮起。

教會模型怎麼「說」,塑造了它怎麼「想」。

09

那,它有意識嗎

說這麼多意識科學的概念,這個問題終究是躲不掉的。

Anthropic 的回答有些克制:這些實驗不能證明 Claude 擁有體驗、或者像人類壹樣有感受。事實上,可能沒有任何實驗能證明或證偽這件事。

但哲學家們通常把「能擁有體驗」(現象意識,phenomenal consciousness)和另壹個純功能性的概念區分開:可及意識(access consciousness)。壹個念頭如果你能報告它、用它推理、拿它指導行動,它就是「可及」的。

而 J-space 則支持起這壹整套功能:它裝著 Claude 能報告、能主動調用、能用來推理的念頭,其余處理則在底下自動運行。

更關鍵的是,這套結構沒人設計,是訓練中自己長出來的。

這意味著支持意識可及的心智工作空間可能不是人腦接線方式的特例,而是智能系統為了解決某類問題會普遍收斂到的方案。

當然,Claude 的工作空間和人腦也有很大的差異。

人腦的工作空間靠循環回路維持,信號在同壹批環路裡反復打轉;Claude 的工作空間只在壹次前向傳播裡演化,用網絡深度頂替了時間的角色。

但另壹方面,人類的工作記憶幾秒就衰退,Claude 靠注意力機制可以直接調取文本中任何位置緩存過的記憶,這點反而比人強。

以及在內容模態上,人類的意識思維有圖像、聲音、動作計劃等多種格式,Claude 的工作空間幾乎全是詞,畢竟……說話是它唯壹能做的動作。

Anthropic 還請了壹圈外部專家來寫獨立評論:

包括全局神經工作空間理論的兩位奠基人 Stanislas Dehaene 和 Lionel Naccache,研究 AI 意識與道德地位的 Eleos AI 團隊,以及 Google DeepMind 可解釋性負責人 Neel Nanda。Neel Nanda 的評論裡還附帶了在開源模型上對部分發現的獨立復現。

至於「AI 有沒有意識」這個終極問題,Anthropic 表示:

不確定我們是否已經走到了那座橋,但是是時候,開始認真思考了。

造出真正擁有體驗的系統會帶來非常棘手的倫理問題,處理它需要哲學家、科學家、宗教領袖、政府和公眾壹起下場。

研究論文和方法、代碼都已經開源,Anthropic 還和 Neuronpedia 合作做了個交互式演示,可以在開源模型上直接玩 J-lens,若有興趣可以上手去試試。

◇ ◆ ◇

博客原文:https://www.anthropic.com/research/global-workspace

完整論文:https://transformer-circuits.pub/2026/workspace/index.html

專家評論(Dehaene、Nanda 等):https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf

Neuronpedia 交互演示:https://neuronpedia.org/jlens

官方推文:https://x.com/AnthropicAI/status/2074185348142280912

[物價飛漲的時候 這樣省錢購物很爽]
好新聞沒人評論怎麼行,我來說幾句
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  •  延伸閱讀
    超微將投資Anthropic多達50億美元 挑戰輝達AI霸權 AI怎樣"想"出答案?Anthropic找到了線索
    挑戰OpenAI與Anthropic 馬斯克發布Grok 4.5 FT:為什麼OpenAI和Anthropic可能難以維持運營
    "中國版Anthropic"這個說法很流行,但並不存在 被控模型蒸餾 阿裡巴巴據報禁用Anthropic工具
    半導體股票暴跌,Anthropic卻想造壹顆2nm芯片 Fable 5解禁,Anthropic同步發Sonnet 5模型搶人
    美國解除大模型管制,Anthropic恢復訪問 特朗普瘋狂打壓Anthropic 奧地利鼓動歐盟"挖牆腳"
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站