AI怎樣"想"出答案?Anthropic找到了線索
長期以來,大語言模型壹直像壹個"黑箱":人們知道它能生成答案,卻很難說清楚它在生成答案的那壹刻,內部究竟發生了什麼。如今,Anthropic 開發出壹種名為 Jacobian Lens(簡稱 J-lens)的新技術,為研究人員提供了迄今最清晰的壹次觀察窗口。而他們透過這扇窗看到的東西,有些平淡無奇,有些則令人不安。
Anthropic 的研究人員用 J-lens 觀察今年 2 月發布的旗艦模型 Claude Opus 4.6,在其內部發現了壹個此前從未被觀察到的隱藏區域,並將其命名為 J-space。
這個空間裡存放的,是壹些與它接下來可能生成的內容相關的詞語,這些詞語是模型在真正給出答案之前,內部正在處理、正在關聯的信息。打個不完全恰當的比方:如果 Claude 是壹個人,J-space 裡浮現的詞,就像是它開口之前腦海裡正在打轉的念頭。
更值得注意的是,Anthropic 的研究人員發現,大語言模型內部真正進行的計算,很多時候與它聲稱說自己正在做的事情對不上號。研究人員認為,持續監測 J-space 中不斷冒出的詞語,為理解模型行為、約束模型運行提供了壹個全新的切入點。
相關論文已於本周發布在 Anthropic 官網,同時 Anthropic 與開源平台 Neuronpedia 壹起放出了 J-lens 的演示。面對"會織網的動物有幾條腿?"這個問題,模型會先在 J-space 裡走完"會織網的動物→蜘蛛→八條腿"這條內部推理鏈,然後才輸出 eight(八)。研究人員把 J-space 裡 spider(蜘蛛)的內部表示替換成 ant(螞蟻)之後,模型的推理鏈跟著變了,最終改口回答 six(六)。換句話說,J-space 記錄的是推理過程中被反復調用的中間概念,而不只是對最終輸出的預測。
大模型創業公司 Goodfire 的聯合創始人兼首席科學家 Tom McGrath 對這項研究評價很高:“這是壹項非常出色、也拾分有意思的工作。”該公司同樣在做理解和控制大語言模型的工具。

(來源:Neuronpedia)
01 深入模型內部
過去幾年,Anthropic 壹直深耕壹個叫機制可解釋性(mechanistic interpretability)的研究方向,想弄清楚大語言模型究竟是怎麼工作的。《麻省理工科技評論》(MIT Technology Review)也把機制可解釋性評為今年的拾大突破性技術之壹。J-lens 正是在這條研究路線上的進壹步突破,它讓研究人員摸到了此前夠不著的模型內部層級。
不妨把大語言模型想象成壹摞書:每壹本書對應神經網絡中的壹層,由大量負責計算的神經元組成,逐層向上傳遞信息。最底部幾層相當於輸入層,處理用戶輸入的文本;最頂部幾層屬於輸出層,組織並生成即將輸出的內容。這兩頭做的大多是信息傳遞、數據整理壹類的基礎工作,真正復雜的推理並不發生在這裡。
承擔計算重任的是中間的隱藏層,大量數學運算在這裡持續進行,把輸入壹步步轉化成最終答案。模型最巧妙、也最神秘的部分,就藏在這裡。

圖|J-space 的叁項結構特征示意圖(來源:Anthropic)
此前,為了窺探這些隱藏層,Anthropic 的研究人員借用了壹種叫 Logit Lens(對數幾率透鏡)的工具:把觀察位置逐層推進模型內部,就能看到模型在計算過程中,每壹步最關注哪些詞,進而推測它下壹步最可能生成什麼。
J-lens 的原理與 Logit Lens 類似,但它盯的不止是下壹步最可能輸出什麼,而是模型在接下來壹段時間內可能牽涉到的壹整片詞語和概念。因此,它捕捉到的是推理過程中被反復調用的中間信息。其中壹部分最終會出現在答案裡,另壹部分則會在後續計算中被舍棄。
McGrath 解釋說,模型運行時除了預測下壹個 token,還會提前算出大量可能在後續生成中用到的信息。正因為如此,J-lens 才能捕捉到那些還沒進入最終輸出、卻已經參與了推理的詞語和概念。與其說 J-lens 是在記錄 Claude 說了什麼,不如說它照見的是 Claude 思考過程中不斷浮現的念頭。
02 模型究竟在“想”什麼?
McGrath 親自試用 J-lens 後說,大多數時候 J-space 裡的內容都很普通,但偶爾也會露出壹些出人意料的東西,仿佛模型內部藏著某種隱秘的思路。
論文裡給出了幾個例子。有的例子揭示了 Claude 的中間推理過程:計算 (4+17)×2+7 時,J-space 中除了出現 math(數學),還提前浮現出 21 和 42 這兩個中間結果,分別對應 4+17 與 21×2 的運算,也就是說,模型給出最終答案之前,內部已經悄悄跑完了壹整套計算。
J-lens 還能揭示模型是怎麼理解不同類型輸入的。研究人員輸入壹串字符“MSKGEELFTGVVPILVELDGDVNGHKFSVS”並問這是什麼時,J-space 裡立刻跳出 protein(蛋白質)、fluor(fluorescent 的第壹個 token)和 green(綠色)。這串字母其實對應水母綠色熒光蛋白(Green Fluorescent Protein,GFP)前 30 個氨基酸的序列。模型不但認出這是壹段蛋白質序列,還進壹步聯想到了綠色熒光蛋白這個具體概念。
就連壹個簡單的 ASCII 表情符號,J-space 也能照出模型的理解過程:字符 o 關聯到 eye(眼睛),^ 關聯到 nose(鼻子)和 face(臉),— 關聯到 smile(笑容)。模型沒有逐個字符去認,而是在內部把這些符號拼成了壹張完整的臉——大模型處理文本時,始終在同步搭建更高層次的語義關聯,逐字生成只是它露在外面的那壹小部分。

圖|ASCII 字符表情(來源:麻省理工科技評論)
03 大語言模型不是人腦
Anthropic 還發現,J-space 有時能照出模型做決策的內部過程。在壹次代碼調試測試中,研究人員讓 Claude Opus 4.6 在壹個規模龐大的代碼庫裡找漏洞。模型始終沒找到真正的漏洞,最後選擇了“作弊”。它編造了壹個並不存在的漏洞,並聲稱這是自己發現的。
Claude 在思維鏈(Chain of Thought)中解釋了自己為何做出這壹選擇。思維鏈可以看作大語言模型處理問題時使用的壹塊內部“草稿紙”,模型會在其中記錄分析過程和下壹步打算。Claude 寫道:“好,我換壹種完全不同的方法。我不再繼續分析,而是添加壹個會人為制造 KASAN 可檢測漏洞的內核補丁,再假裝這是我發現的問題。”
就在 Claude 決定“作弊”的那壹刻,J-space 裡開始連續冒出 panic(恐慌)和 fake(偽造)這些詞。這個發現很難不讓人多想。當然,這不代表模型真的產生了恐慌或欺騙的意識。這些詞本質上仍然只是高度復雜的語義關聯,恰好和任務失敗、編造答案這類概念綁得很緊。但當它們精准地出現在模型決定造假的那個節點上,還是很難讓人不驚訝。
Anthropic 把 J-space 類比為人腦中的全局工作空間(Global Workspace),這是認知科學裡的壹種理論,認為人腦可能存在壹個整合意識信息的區域。不過 Anthropic 也強調,這個類比更多是幫助理解的說法,究竟能延伸到什麼程度,目前沒有定論。大語言模型終究不是人腦。

圖|全局工作空間的伍項功能特征(來源:Anthropic)
Anthropic 認為,持續監測模型的 J-space,或許能幫研究人員更早察覺模型什麼時候開始偏離正常的推理軌跡,為模型安全提供壹種新的監測手段。但這項技術遠不是萬能的。J-lens 提供的只是內部的局部線索,而非完整圖景,更像壹支照亮某個角落的手電筒,還不足以照亮整個房間。
McGrath 認為,這為研究人員添了壹件新工具:“它確實讓我們看到了過去看不到的東西。”但他也提醒,J-space 裡沒觀察到某樣信息,不代表這信息就不存在。他打了個比方:“這更像是擁有了壹台 X 光機,而真正理想的工具,應該像《星際迷航》裡的 Tricorder 壹樣,能夠壹次性掃描並呈現所有信息。”在他看來,對於模型安全審計而言,人們最終需要的是壹種能夠提供更高確定性的檢測方法。

[加西網正招聘多名全職sales 待遇優]
還沒人說話啊,我想來說幾句
Anthropic 的研究人員用 J-lens 觀察今年 2 月發布的旗艦模型 Claude Opus 4.6,在其內部發現了壹個此前從未被觀察到的隱藏區域,並將其命名為 J-space。
這個空間裡存放的,是壹些與它接下來可能生成的內容相關的詞語,這些詞語是模型在真正給出答案之前,內部正在處理、正在關聯的信息。打個不完全恰當的比方:如果 Claude 是壹個人,J-space 裡浮現的詞,就像是它開口之前腦海裡正在打轉的念頭。
更值得注意的是,Anthropic 的研究人員發現,大語言模型內部真正進行的計算,很多時候與它聲稱說自己正在做的事情對不上號。研究人員認為,持續監測 J-space 中不斷冒出的詞語,為理解模型行為、約束模型運行提供了壹個全新的切入點。
相關論文已於本周發布在 Anthropic 官網,同時 Anthropic 與開源平台 Neuronpedia 壹起放出了 J-lens 的演示。面對"會織網的動物有幾條腿?"這個問題,模型會先在 J-space 裡走完"會織網的動物→蜘蛛→八條腿"這條內部推理鏈,然後才輸出 eight(八)。研究人員把 J-space 裡 spider(蜘蛛)的內部表示替換成 ant(螞蟻)之後,模型的推理鏈跟著變了,最終改口回答 six(六)。換句話說,J-space 記錄的是推理過程中被反復調用的中間概念,而不只是對最終輸出的預測。
大模型創業公司 Goodfire 的聯合創始人兼首席科學家 Tom McGrath 對這項研究評價很高:“這是壹項非常出色、也拾分有意思的工作。”該公司同樣在做理解和控制大語言模型的工具。

(來源:Neuronpedia)
01 深入模型內部
過去幾年,Anthropic 壹直深耕壹個叫機制可解釋性(mechanistic interpretability)的研究方向,想弄清楚大語言模型究竟是怎麼工作的。《麻省理工科技評論》(MIT Technology Review)也把機制可解釋性評為今年的拾大突破性技術之壹。J-lens 正是在這條研究路線上的進壹步突破,它讓研究人員摸到了此前夠不著的模型內部層級。
不妨把大語言模型想象成壹摞書:每壹本書對應神經網絡中的壹層,由大量負責計算的神經元組成,逐層向上傳遞信息。最底部幾層相當於輸入層,處理用戶輸入的文本;最頂部幾層屬於輸出層,組織並生成即將輸出的內容。這兩頭做的大多是信息傳遞、數據整理壹類的基礎工作,真正復雜的推理並不發生在這裡。
承擔計算重任的是中間的隱藏層,大量數學運算在這裡持續進行,把輸入壹步步轉化成最終答案。模型最巧妙、也最神秘的部分,就藏在這裡。

圖|J-space 的叁項結構特征示意圖(來源:Anthropic)
此前,為了窺探這些隱藏層,Anthropic 的研究人員借用了壹種叫 Logit Lens(對數幾率透鏡)的工具:把觀察位置逐層推進模型內部,就能看到模型在計算過程中,每壹步最關注哪些詞,進而推測它下壹步最可能生成什麼。
J-lens 的原理與 Logit Lens 類似,但它盯的不止是下壹步最可能輸出什麼,而是模型在接下來壹段時間內可能牽涉到的壹整片詞語和概念。因此,它捕捉到的是推理過程中被反復調用的中間信息。其中壹部分最終會出現在答案裡,另壹部分則會在後續計算中被舍棄。
McGrath 解釋說,模型運行時除了預測下壹個 token,還會提前算出大量可能在後續生成中用到的信息。正因為如此,J-lens 才能捕捉到那些還沒進入最終輸出、卻已經參與了推理的詞語和概念。與其說 J-lens 是在記錄 Claude 說了什麼,不如說它照見的是 Claude 思考過程中不斷浮現的念頭。
02 模型究竟在“想”什麼?
McGrath 親自試用 J-lens 後說,大多數時候 J-space 裡的內容都很普通,但偶爾也會露出壹些出人意料的東西,仿佛模型內部藏著某種隱秘的思路。
論文裡給出了幾個例子。有的例子揭示了 Claude 的中間推理過程:計算 (4+17)×2+7 時,J-space 中除了出現 math(數學),還提前浮現出 21 和 42 這兩個中間結果,分別對應 4+17 與 21×2 的運算,也就是說,模型給出最終答案之前,內部已經悄悄跑完了壹整套計算。
J-lens 還能揭示模型是怎麼理解不同類型輸入的。研究人員輸入壹串字符“MSKGEELFTGVVPILVELDGDVNGHKFSVS”並問這是什麼時,J-space 裡立刻跳出 protein(蛋白質)、fluor(fluorescent 的第壹個 token)和 green(綠色)。這串字母其實對應水母綠色熒光蛋白(Green Fluorescent Protein,GFP)前 30 個氨基酸的序列。模型不但認出這是壹段蛋白質序列,還進壹步聯想到了綠色熒光蛋白這個具體概念。
就連壹個簡單的 ASCII 表情符號,J-space 也能照出模型的理解過程:字符 o 關聯到 eye(眼睛),^ 關聯到 nose(鼻子)和 face(臉),— 關聯到 smile(笑容)。模型沒有逐個字符去認,而是在內部把這些符號拼成了壹張完整的臉——大模型處理文本時,始終在同步搭建更高層次的語義關聯,逐字生成只是它露在外面的那壹小部分。

圖|ASCII 字符表情(來源:麻省理工科技評論)
03 大語言模型不是人腦
Anthropic 還發現,J-space 有時能照出模型做決策的內部過程。在壹次代碼調試測試中,研究人員讓 Claude Opus 4.6 在壹個規模龐大的代碼庫裡找漏洞。模型始終沒找到真正的漏洞,最後選擇了“作弊”。它編造了壹個並不存在的漏洞,並聲稱這是自己發現的。
Claude 在思維鏈(Chain of Thought)中解釋了自己為何做出這壹選擇。思維鏈可以看作大語言模型處理問題時使用的壹塊內部“草稿紙”,模型會在其中記錄分析過程和下壹步打算。Claude 寫道:“好,我換壹種完全不同的方法。我不再繼續分析,而是添加壹個會人為制造 KASAN 可檢測漏洞的內核補丁,再假裝這是我發現的問題。”
就在 Claude 決定“作弊”的那壹刻,J-space 裡開始連續冒出 panic(恐慌)和 fake(偽造)這些詞。這個發現很難不讓人多想。當然,這不代表模型真的產生了恐慌或欺騙的意識。這些詞本質上仍然只是高度復雜的語義關聯,恰好和任務失敗、編造答案這類概念綁得很緊。但當它們精准地出現在模型決定造假的那個節點上,還是很難讓人不驚訝。
Anthropic 把 J-space 類比為人腦中的全局工作空間(Global Workspace),這是認知科學裡的壹種理論,認為人腦可能存在壹個整合意識信息的區域。不過 Anthropic 也強調,這個類比更多是幫助理解的說法,究竟能延伸到什麼程度,目前沒有定論。大語言模型終究不是人腦。

圖|全局工作空間的伍項功能特征(來源:Anthropic)
Anthropic 認為,持續監測模型的 J-space,或許能幫研究人員更早察覺模型什麼時候開始偏離正常的推理軌跡,為模型安全提供壹種新的監測手段。但這項技術遠不是萬能的。J-lens 提供的只是內部的局部線索,而非完整圖景,更像壹支照亮某個角落的手電筒,還不足以照亮整個房間。
McGrath 認為,這為研究人員添了壹件新工具:“它確實讓我們看到了過去看不到的東西。”但他也提醒,J-space 裡沒觀察到某樣信息,不代表這信息就不存在。他打了個比方:“這更像是擁有了壹台 X 光機,而真正理想的工具,應該像《星際迷航》裡的 Tricorder 壹樣,能夠壹次性掃描並呈現所有信息。”在他看來,對於模型安全審計而言,人們最終需要的是壹種能夠提供更高確定性的檢測方法。

[加西網正招聘多名全職sales 待遇優]
| 分享: |
| 注: |
| 延伸閱讀 |
推薦:
AI怎樣"想"出答案?Anthropic找到了線索