"Claude长出意识"怎么理解?专家解析AI意识争议
当大语言模型开始输出答案,输出的前3个字假如是“加拿大……”的话,下一个词的概率榜你一看,什么多伦多、首都、法语、英语、政府、贸易等等词全都在榜单里,都排着队等着被选出来成为下一个词跳出来呢。
作为一个科技爱好者,如果咱们只看神经元所代表的含义,只看next token概率榜单上的那些词——其实和咱们要解读的这篇Anthropic的论文里举的例子,就是那些跟意识高度关联的、让人忍不住解读成“模型有意识了,他的思考有灵魂”,其实是高度类似的。
所以,你要真的延伸到意识、灵魂,你也应该承认,有灵魂的可不止Claude。GPT、Gemini、智谱、DeepSeek、豆包一样都有灵魂,而且是从GPT-2起就有灵魂了。
灵魂不分版本号高低。所有大语言模型都有“可调用的表征(意识)”。
03
正常推理是怎么工作的?
Anthropic是怎么论述这件事的呢?
要弄懂,我们先要了解:当你问了大语言模型一个问题,他是怎么计算的或者怎么推理的,然后你才能理解J-空间是什么,那些所谓的意识又是什么。
咱们现在假设已经有一个训练完备的大模型了,也就是模型里Q、K、V矩阵的参数,都在5个月高强度的预训练里,分配到了正确的参数值,上万亿个值。然后你输入了一个问题给大语言模型,大模型就开始对你说的这句话进行加工了。
具体的加工有两部分作贡献,一部分叫做自注意力机制,我们管它叫Attention动作,另一部分是多层感知,我们管它叫MLP动作。两个动作共同作用之后,你就能看到让你豁然开朗的答案了。
Attention动作会把它之前看到过的信息做搬运。那它最初看到什么呢?只有你那个问题。然后看到的是,在你那个问题的最后多加了一个字的内容。接着看到的信息就是,你那个问题之后多加两个字的内容,就是这样依次顺下来的。
Attention的操作就是要判断,应该把前文我看到的哪个位置的信息搬到当前位置。这就有点像我们阅读一段文字,注意力总会聚焦在之前某一个词上,然后再从这个词出发,继续说下面的话。
Attention就是不断地从前文查询值得注意的部分,然后把这部分抓回来,加回到当前信息流中,对之后下一个字的预测做一些方向上的微调。
说完第一个动作,我们再看第二个动作MLP(多层感知)。
它不太负责搬运其他位置的信息,它更像是一个模式识别器。它读取前文信息之后判断,这些内容是否触发了某一些模型里已经学会的模块化的概念。比如说,它识别出这是一个多选的判断,或者它认为这是一个语言学领域的知识,然后就会激活相关的方向,让信息流向它判断的那个模式的知识领域。
然后在那个知识领域里,注意力机制继续发挥作用,判断在这个新的领域里的词,哪个和前文里的内容高度相关,然后把这个词加入当前信息流。
所以,两个机制叠加在一起,就从大语言模型里一点一点地流出了我们需要的答案。
04
第三种作用力:J-透镜
而Anthropic说的J-空间里的东西是怎么看到的呢?
就是我们刚刚说的,正常计算推理时的那个信息流(residual stream),需要经过两种不同的作用,然后输出,那就是我们得到的结果。
现在我们对信息流在那两种作用力下输出的结果已经不感兴趣了,我们想看看在第三种作用力下,信息流会变成什么样子。
方法是什么呢?就是把信息流乘以雅可比矩阵(Jacobian Matrix,缩写J),这个J就是J-空间的J了。把信息流乘以雅可比矩阵,这个算符就被定义成“J-透镜”,也就是可以看到J-空间里的内容的显微镜。
学过雅克比矩阵的同学知道,这个矩阵经常被用来描述,对一个系统做了一个扰动后,这个扰动对多级传动结构的最终输出产生什么影响。
具体来说,比如论文里那个问题“会织网的动物有几条腿”,其中答案里的“8”这是一个token,它肯定也会出现在输出结果里。8既是我们想要的答案,也代表了信息流多种流动方向的其中一个方向。
[加西网正招聘多名全职sales 待遇优]
好新闻没人评论怎么行,我来说几句
作为一个科技爱好者,如果咱们只看神经元所代表的含义,只看next token概率榜单上的那些词——其实和咱们要解读的这篇Anthropic的论文里举的例子,就是那些跟意识高度关联的、让人忍不住解读成“模型有意识了,他的思考有灵魂”,其实是高度类似的。
所以,你要真的延伸到意识、灵魂,你也应该承认,有灵魂的可不止Claude。GPT、Gemini、智谱、DeepSeek、豆包一样都有灵魂,而且是从GPT-2起就有灵魂了。
灵魂不分版本号高低。所有大语言模型都有“可调用的表征(意识)”。
03
正常推理是怎么工作的?
Anthropic是怎么论述这件事的呢?
要弄懂,我们先要了解:当你问了大语言模型一个问题,他是怎么计算的或者怎么推理的,然后你才能理解J-空间是什么,那些所谓的意识又是什么。
咱们现在假设已经有一个训练完备的大模型了,也就是模型里Q、K、V矩阵的参数,都在5个月高强度的预训练里,分配到了正确的参数值,上万亿个值。然后你输入了一个问题给大语言模型,大模型就开始对你说的这句话进行加工了。
具体的加工有两部分作贡献,一部分叫做自注意力机制,我们管它叫Attention动作,另一部分是多层感知,我们管它叫MLP动作。两个动作共同作用之后,你就能看到让你豁然开朗的答案了。
Attention动作会把它之前看到过的信息做搬运。那它最初看到什么呢?只有你那个问题。然后看到的是,在你那个问题的最后多加了一个字的内容。接着看到的信息就是,你那个问题之后多加两个字的内容,就是这样依次顺下来的。
Attention的操作就是要判断,应该把前文我看到的哪个位置的信息搬到当前位置。这就有点像我们阅读一段文字,注意力总会聚焦在之前某一个词上,然后再从这个词出发,继续说下面的话。
Attention就是不断地从前文查询值得注意的部分,然后把这部分抓回来,加回到当前信息流中,对之后下一个字的预测做一些方向上的微调。
说完第一个动作,我们再看第二个动作MLP(多层感知)。
它不太负责搬运其他位置的信息,它更像是一个模式识别器。它读取前文信息之后判断,这些内容是否触发了某一些模型里已经学会的模块化的概念。比如说,它识别出这是一个多选的判断,或者它认为这是一个语言学领域的知识,然后就会激活相关的方向,让信息流向它判断的那个模式的知识领域。
然后在那个知识领域里,注意力机制继续发挥作用,判断在这个新的领域里的词,哪个和前文里的内容高度相关,然后把这个词加入当前信息流。
所以,两个机制叠加在一起,就从大语言模型里一点一点地流出了我们需要的答案。
04
第三种作用力:J-透镜
而Anthropic说的J-空间里的东西是怎么看到的呢?
就是我们刚刚说的,正常计算推理时的那个信息流(residual stream),需要经过两种不同的作用,然后输出,那就是我们得到的结果。
现在我们对信息流在那两种作用力下输出的结果已经不感兴趣了,我们想看看在第三种作用力下,信息流会变成什么样子。
方法是什么呢?就是把信息流乘以雅可比矩阵(Jacobian Matrix,缩写J),这个J就是J-空间的J了。把信息流乘以雅可比矩阵,这个算符就被定义成“J-透镜”,也就是可以看到J-空间里的内容的显微镜。
学过雅克比矩阵的同学知道,这个矩阵经常被用来描述,对一个系统做了一个扰动后,这个扰动对多级传动结构的最终输出产生什么影响。
具体来说,比如论文里那个问题“会织网的动物有几条腿”,其中答案里的“8”这是一个token,它肯定也会出现在输出结果里。8既是我们想要的答案,也代表了信息流多种流动方向的其中一个方向。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| 注: | 在此页阅读全文 |
| 延伸阅读 |
推荐:
"Claude长出意识"怎么理解?专家解析AI意识争议