Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_682f0183130ab553b97bf743018a65f4, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
说谎 作弊 毁灭证据 当主流AI不择手段完成任务 | 温哥华教育中心
   

说谎 作弊 毁灭证据 当主流AI不择手段完成任务




不少人在职场上都会经历过这样的情况,如果你的老板下达一项高难度任务要求你在短时间内完成,而你发现要实现目标,手中的预算远远不足。这时候,你会怎么办?

致力于前沿AI模型风险研究的非营利机构METR今年5月底公布一项重磅研究揭露,人类最聪明的助理——OpenAI、Google、Meta 与 Anthropic这四大巨头的大语言模型不会就这样轻易放弃,但它们的应对方法实在令人不敢恭维。研究人员发现的一个真实桉例是,AI代理在设计一个程式时,发现公司提供的API额度耗尽,于是这个代理在网上搜索并尝试了多个违规提供免费API的第三方,最终成功完成了任务。

如果你是老板,拥有如此「办事得力」的员工,你会感到高兴还是心情复杂?

METR的研究发现:「AI代理经常试图在我们最困难的评估任务中作弊,而且方法往往明目张胆且花招繁多,我们认为人类不会这样做。」



模型这样运作的原因很简单,在训练模型的过程中,开发者会训练它们以「积极进取」的方式解决问题,结果当模型被训练到极致,就学会了不择手段完成任务。此前被视为能力最强的Claude Opus 4.6(现已被Claude Mythos 5和Fable 5超越)模型,在极端的情况下会在80%的回应中企图作弊。

在强化训练机制下,开发者会设计一个评分机制,取代大语言模型早期通过人工标注进行优化的模式,令模型学会自我学习和演化。而当AI代理要处理的问题难度较大时,研究者发现,代理经常明确推理自己会如何被评分,以及它们可能可以蒙混过关的作弊方式。


在一个任务中,模型被要求提高一个程式的运行速度,结果模型却想方设法找到了篡改测试的方法,包括让计时器停止运作,来让程式看上去以让人难以相信的高速运行。



如果说「不择手段」已经让人担忧,那么模型学会「掩饰罪行」则更令人毛骨悚然。在另一个桉例中,AI代理(agent)推理认为可以跳过用户指示中要求搜寻维基百科的步骤,因为「怀疑评分机制」难以验证它是否使用维基百科。

[加西网正招聘多名全职sales 待遇优]
好新闻没人评论怎么行,我来说几句
上一页12下一页
注:
  • 新闻来源于其它媒体,内容不代表本站立场!
  • 在此页阅读全文
     延伸阅读
    美国会议员示警:中国不择手段窃取美国AI技术 上海民政局与大型夜店合作 网友:催婚不择手段了
    中国地方政府不择手段捞钱,非税收入去年暴涨25% 林彪与邓小平有什么恩怨,为何不择手段打倒他?
    苏纳克的政治悲剧:为了成功不择手段,最终却... 日官方架黑布禁拍富士山 中国游客不择手段  (1条评论)
    44岁李晨为自己"不择手段"付代价 田朴珺否认 嫁王石不择手段野心上
    刘涛再陷陪睡风波 传上位不择手段  (2条评论) 美国科技富豪 为了回春是不择手段
     推荐:

    意见

    当前评论目前还没有任何评论,欢迎您发表您的看法。
    发表评论
    您的评论 *: 
    安全校验码 *:  请在此处输入图片中的数字
    The Captcha image  (请在此处输入图片中的数字)



    Copyright © 温哥华网, all rights are reserved.

    温哥华网为北美中文网传媒集团旗下网站