图灵奖得主警告:当前安全措施 追不上AI能力狂飙
第一层是“不敢为”。通过加装安全围栏等外部惩罚机制形成约束,让AI因为害怕代价而不敢越界。这是目前AI行业投入精力最多的层面。
第二层是“不能为”。从数学底座、优化函数和系统架构层面做内置约束,让AI从根本上没有犯错的能力。
第三层是“不欲为”。让AI在心智和逻辑层面,把道德与法律变成一种近乎“本能”的东西,达到一种类似“明心见性”的状态,自己就不想做坏事。
熊辉承认,眼下AI行业在底座架构和目标函数层面的内生安全努力还远远不够,技术差距依然巨大。但他同时抛出一个构想:一旦内核层面的安全控制得以实现,就可以把安全内核保持闭源,而外围部分更放心地开源。
这或许会为开源模型的安全治理打开一条全新的路径。
02 编程能力飙升,安全能力滑坡

周伯文发表演讲
安全的挑战从来不是孤立的,它和AI的能力边界息息相关。
周伯文在演讲中揭示了一组冷热反差,从另一个维度解释了安全问题的紧迫性。
他指出,过去18个月,AI的编程成功率从5%一路飙升到88%,以至于国外一半的基准测试因为模型表现太强,已经失去了参考价值。
“整个行业都在感受强烈的推背感。”周伯文说。
但科学发现领域却是另一番景象。
艾伦研究所发布的端到端科学研究评测显示,同一时期,表现最好的大模型在科学任务上的完成率始终停在3%,几乎纹丝不动。大部分模型卡在60%到70%的区间,无法独立跑完科研全流程。

NatureBench(周伯文团队联合衔远科技等发布的AI编码智能体评测基准?)显示:AI产出一篇超越当前最好成果的科学论文,成功率只有17.8%。《自然》杂志的一篇研究论文据此判断,目前AI产出的科学工作都属于“增量发现”,还没有出现根本性突破。
一边是编程能力逼近天花板,一边是科研能力原地踏步。周伯文将出现这种反差的原因归结为三个层面:

[加西网正招聘多名全职sales 待遇优]
还没人说话啊,我想来说几句
第二层是“不能为”。从数学底座、优化函数和系统架构层面做内置约束,让AI从根本上没有犯错的能力。
第三层是“不欲为”。让AI在心智和逻辑层面,把道德与法律变成一种近乎“本能”的东西,达到一种类似“明心见性”的状态,自己就不想做坏事。
熊辉承认,眼下AI行业在底座架构和目标函数层面的内生安全努力还远远不够,技术差距依然巨大。但他同时抛出一个构想:一旦内核层面的安全控制得以实现,就可以把安全内核保持闭源,而外围部分更放心地开源。
这或许会为开源模型的安全治理打开一条全新的路径。
02 编程能力飙升,安全能力滑坡

周伯文发表演讲
安全的挑战从来不是孤立的,它和AI的能力边界息息相关。
周伯文在演讲中揭示了一组冷热反差,从另一个维度解释了安全问题的紧迫性。
他指出,过去18个月,AI的编程成功率从5%一路飙升到88%,以至于国外一半的基准测试因为模型表现太强,已经失去了参考价值。
“整个行业都在感受强烈的推背感。”周伯文说。
但科学发现领域却是另一番景象。
艾伦研究所发布的端到端科学研究评测显示,同一时期,表现最好的大模型在科学任务上的完成率始终停在3%,几乎纹丝不动。大部分模型卡在60%到70%的区间,无法独立跑完科研全流程。

NatureBench(周伯文团队联合衔远科技等发布的AI编码智能体评测基准?)显示:AI产出一篇超越当前最好成果的科学论文,成功率只有17.8%。《自然》杂志的一篇研究论文据此判断,目前AI产出的科学工作都属于“增量发现”,还没有出现根本性突破。
一边是编程能力逼近天花板,一边是科研能力原地踏步。周伯文将出现这种反差的原因归结为三个层面:

[加西网正招聘多名全职sales 待遇优]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
推荐:
图灵奖得主警告:当前安全措施 追不上AI能力狂飙