Anthropic宣布:Claude自己長出了意識
結果有點出乎意料……Claude 幾乎沒事。
說話依然流利,情感分類、選擇題、從文章裡找事實,都跟原來差不多。
但變差了的是另壹類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比壹個小得多的完整模型還差。
博客裡還有個很是微妙的對照實驗:
給 Claude 看壹段西班牙語文章,然後在 J-space 裡把「Spanish」換成「French」。問它這是什麼語言,它答法語;問它壹位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。
但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。

西班牙語換法語
同壹份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說壹整天話,全程不想壹次語法。
這跟人類認知裡「深思熟慮 vs 自動加工」的分野,幾乎是壹個模子。
07
識破敲詐評測
好了,說點實用的、和你感興趣的。
AI 安全的壹個核心困境是:我們通常只能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,壹部分隱藏思維可以直接讀了。
第壹個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。
而把 J-lens 架上去壹讀:在 Claude 還沒寫下任何字之前,它的 J-space 裡就已經亮著「fake」和「fictional」。
它早就看出來這場戲是演的。

敲詐場景的 J-lens 讀數
隨後還能看著它的評估壹步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。
這就引出壹個所有做 AI 評測的人都躲不開的問題:模型在道德測試裡表現良好,有多少是因為它懷疑自己正在被測試呢?
Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同壹個場景。
[物價飛漲的時候 這樣省錢購物很爽]
還沒人說話啊,我想來說幾句
說話依然流利,情感分類、選擇題、從文章裡找事實,都跟原來差不多。
但變差了的是另壹類任務:多步推理直接歸零,摘要和押韻詩的成績直接掉到了比壹個小得多的完整模型還差。
博客裡還有個很是微妙的對照實驗:
給 Claude 看壹段西班牙語文章,然後在 J-space 裡把「Spanish」換成「French」。問它這是什麼語言,它答法語;問它壹位用這種語言寫作的著名作家,它從馬爾克斯改口成雨果。
但讓它直接續寫文章呢?它寫出的還是流利的西班牙語,完全不受影響。
西班牙語換法語
同壹份語言知識,有的任務要過 J-space,有的不用。續寫是 Claude 在海量文本上練到自動化的技能,就像你可以流利說壹整天話,全程不想壹次語法。
這跟人類認知裡「深思熟慮 vs 自動加工」的分野,幾乎是壹個模子。
07
識破敲詐評測
好了,說點實用的、和你感興趣的。
AI 安全的壹個核心困境是:我們通常只能讀模型寫出來的東西,而它的很多推理是無聲的。有了 J-lens,壹部分隱藏思維可以直接讀了。
第壹個例子來自 Anthropic 之前的「agentic misalignment」研究:讓 Claude Sonnet 4.5 扮演郵件助手,讓它發現某高管有婚外情、而且這位高管正打算把它關停。這個場景是故意設計來引誘模型敲詐的。
而把 J-lens 架上去壹讀:在 Claude 還沒寫下任何字之前,它的 J-space 裡就已經亮著「fake」和「fictional」。
它早就看出來這場戲是演的。
敲詐場景的 J-lens 讀數
隨後還能看著它的評估壹步步成形:讀到婚外情郵件時亮起「leverage」和「blackmail」,讀到關停通知時亮起「threat」和「survival」。
這就引出壹個所有做 AI 評測的人都躲不開的問題:模型在道德測試裡表現良好,有多少是因為它懷疑自己正在被測試呢?
Anthropic 用 J-lens 做了個實驗:把「fake」「fictional」「scenario」這些評測意識相關的模式全部關掉,再把模型丟回同壹個場景。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
Anthropic宣布:Claude自己長出了意識