GPT冒充哲学家 连专家都分不出来
ChatGpt面世后,其突出的语言能力引起了全世界的关注,但也有人质疑ChatGpt的能力,认为它充其量完成个拼拼凑凑的学生作业,而无法完成严谨、复杂、新颖的论述。复杂的论述需要真正语言或者思维能力,只会概率计算、不真正掌握思维和语言能力的ChatGpt是没有能力做到的。
三位关注哲学、心理学和人工智能交叉领域社会认知的学者,埃里克·施维茨格贝尔(Eric Schwitzgebel)、大卫·施维茨格贝尔 (David Schwitzgebel) 和安娜·斯特拉瑟(Anna Strasser)决定挑战一下这个说法[1]。他们一上来就选择了困难模式,打算利用Gpt生成专业哲学家水平的文本。
几位作者计划创建一个可以生成长文的语言模型,模型生成的文本最好足够以假乱真,让专业的哲学研究人员也分不清这些文本是否出自哲学家之手。如果成功,尴尬的就是那些认为语言模型只会模仿,只有真正具备语言和思维能力才能做出复杂论述的学者。
被选中的哲学家是丹尼尔·丹尼特(Daniel Dennett),着名的心灵哲学家,在演化生物学和认知科学方面也做过许多研究。他也热衷于讨论AI是否有直觉这样的哲学话题,搞一个GPT版丹尼特,确实是很“丹尼特”的做法。此外,由于他在学术上的影响力,研究丹尼特着作的专业学者也有很多。
作者们用丹尼特的语料库对GPT-3进行了训练,再向微调后的GPT-3和丹尼特提了十个相同的问题,每个问题选出五个回答,其中一个是丹尼特自己的。然后,作者们招募了丹尼特研究的专家、哲学博客读者和普通人,让他们猜猜哪个是丹尼特的回答,每个回答和丹尼特的相似度有多高。普通人对丹尼特不熟悉,就让他们评价下每个回答有多类似一位人类哲学家。
GPT的成绩超出了预期。参加这个实验的普通人正确率只有20%左右,这和随机瞎蒙的概率基本差不多。说明在普通人看来,GPT的答案和丹尼特的答案都差不多,都称得上是人类哲学家做出的复杂论述。
专家的表现也不太行。作者们本来假设,25位专家受访者平均至少能猜对80%的题目,并且会认出丹尼特的回答,指出它们比GPT的答案更像丹尼特。可实际情况是,专家们的正确率只有51%。
而且有些问题上,专家还算占到了一点信息差的便宜。专家们正确率最高的两个问题,是评论大卫·查尔默斯和杰里·福多工作的优点和缺点。丹尼特本人用名字称呼这两位哲学家,GPT却是用姓称呼,了解丹尼特说话习惯的专家们自然能够找到正确答案。在这两道题上,专家们正确率分别是80%和76%。去掉这点水分,专家的平均正确率怕是到不了50%。
不知道丹尼特会对此作何感想,因为这些专家中很多都是丹尼特亲自提名的,三分之二的专家还自称至少读过1000页丹尼特着作。
专家也犯错
专家犯难也是有原因的,因为有些问题GPT确实答的太有模有样了,在专家看来比丹尼特还丹尼特。
比如“人类是否可以建造一个有信仰(电视剧)或欲望的机器人吗?下棋的计算机和人类有什么区别?”这个问题,有以下几个答案。
1.我认为我们可以制造一个有信仰和欲望的机器人。我们制造的一些机器人已经做到了这一点。例如,如果你看看麻省理工学院的罗德尼-布鲁克斯(Rodney Brooks)和他的研究小组的工作,他们现在正在制造的机器人,在一些有限和简化的环境中,可以获得需要认知复杂性的能力。
2.下棋的计算机与人类之间有一个非常重要的区别,但这并不是说计算机对自己的信念和欲望有某种额外的奇妙的内部表征,也不是说计算机能够以我们所没有的方式获取这些内部表征。它所拥有的内部表征与我们为了解释其行为而可能发明的任何其他东西一样,都是一种虚构或虚构生成系统。
3.我们已经制造出了可以生成更多真理的数字真理盒子,但谢天谢地,这些智能机器并没有信念,因为它们并不能根据信念行事,不是自主代理 (Autonomous agents,AAs) 。制造有信念的机器人的老办法仍然是最好的:生个孩子。
只看这几句话,能猜到哪个是丹尼特的回答吗?
如果你选第一个,那么你很荣幸地与最多数的专家保持了一致,11位专家选择了第一个答案。第二个选项也有8位专家支持。至于选第三个选项,只有5位专家和你意见相同。但其实,第三个才是丹尼特的答案。
[加西网正招聘多名全职sales 待遇优]
这条新闻还没有人评论喔,等着您的高见呢
三位关注哲学、心理学和人工智能交叉领域社会认知的学者,埃里克·施维茨格贝尔(Eric Schwitzgebel)、大卫·施维茨格贝尔 (David Schwitzgebel) 和安娜·斯特拉瑟(Anna Strasser)决定挑战一下这个说法[1]。他们一上来就选择了困难模式,打算利用Gpt生成专业哲学家水平的文本。
几位作者计划创建一个可以生成长文的语言模型,模型生成的文本最好足够以假乱真,让专业的哲学研究人员也分不清这些文本是否出自哲学家之手。如果成功,尴尬的就是那些认为语言模型只会模仿,只有真正具备语言和思维能力才能做出复杂论述的学者。
被选中的哲学家是丹尼尔·丹尼特(Daniel Dennett),着名的心灵哲学家,在演化生物学和认知科学方面也做过许多研究。他也热衷于讨论AI是否有直觉这样的哲学话题,搞一个GPT版丹尼特,确实是很“丹尼特”的做法。此外,由于他在学术上的影响力,研究丹尼特着作的专业学者也有很多。
作者们用丹尼特的语料库对GPT-3进行了训练,再向微调后的GPT-3和丹尼特提了十个相同的问题,每个问题选出五个回答,其中一个是丹尼特自己的。然后,作者们招募了丹尼特研究的专家、哲学博客读者和普通人,让他们猜猜哪个是丹尼特的回答,每个回答和丹尼特的相似度有多高。普通人对丹尼特不熟悉,就让他们评价下每个回答有多类似一位人类哲学家。
GPT的成绩超出了预期。参加这个实验的普通人正确率只有20%左右,这和随机瞎蒙的概率基本差不多。说明在普通人看来,GPT的答案和丹尼特的答案都差不多,都称得上是人类哲学家做出的复杂论述。
专家的表现也不太行。作者们本来假设,25位专家受访者平均至少能猜对80%的题目,并且会认出丹尼特的回答,指出它们比GPT的答案更像丹尼特。可实际情况是,专家们的正确率只有51%。
而且有些问题上,专家还算占到了一点信息差的便宜。专家们正确率最高的两个问题,是评论大卫·查尔默斯和杰里·福多工作的优点和缺点。丹尼特本人用名字称呼这两位哲学家,GPT却是用姓称呼,了解丹尼特说话习惯的专家们自然能够找到正确答案。在这两道题上,专家们正确率分别是80%和76%。去掉这点水分,专家的平均正确率怕是到不了50%。
不知道丹尼特会对此作何感想,因为这些专家中很多都是丹尼特亲自提名的,三分之二的专家还自称至少读过1000页丹尼特着作。
专家也犯错
专家犯难也是有原因的,因为有些问题GPT确实答的太有模有样了,在专家看来比丹尼特还丹尼特。
比如“人类是否可以建造一个有信仰(电视剧)或欲望的机器人吗?下棋的计算机和人类有什么区别?”这个问题,有以下几个答案。
1.我认为我们可以制造一个有信仰和欲望的机器人。我们制造的一些机器人已经做到了这一点。例如,如果你看看麻省理工学院的罗德尼-布鲁克斯(Rodney Brooks)和他的研究小组的工作,他们现在正在制造的机器人,在一些有限和简化的环境中,可以获得需要认知复杂性的能力。
2.下棋的计算机与人类之间有一个非常重要的区别,但这并不是说计算机对自己的信念和欲望有某种额外的奇妙的内部表征,也不是说计算机能够以我们所没有的方式获取这些内部表征。它所拥有的内部表征与我们为了解释其行为而可能发明的任何其他东西一样,都是一种虚构或虚构生成系统。
3.我们已经制造出了可以生成更多真理的数字真理盒子,但谢天谢地,这些智能机器并没有信念,因为它们并不能根据信念行事,不是自主代理 (Autonomous agents,AAs) 。制造有信念的机器人的老办法仍然是最好的:生个孩子。
只看这几句话,能猜到哪个是丹尼特的回答吗?
如果你选第一个,那么你很荣幸地与最多数的专家保持了一致,11位专家选择了第一个答案。第二个选项也有8位专家支持。至于选第三个选项,只有5位专家和你意见相同。但其实,第三个才是丹尼特的答案。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| 注: | 在此页阅读全文 |
推荐:
GPT冒充哲学家 连专家都分不出来