当AI自己行动,人类还安全吗?图灵奖得主谈AI安全

左起依次为:上海人工智能实验室主任周伯文、图灵奖得主约书亚·本吉奥、清华大学教授薛澜。
7月19日,在2026世界人工智能大会(WAIC)“前沿AI与智能体安全”论坛上,图灵奖得主约书亚·本吉奥、上海人工智能实验室主任周伯文、清华大学教授薛澜等多位嘉宾,针对当前AI的发展走向与全球治理发表了见解。
他们聚焦的核心问题是,在智能体和自主提升技术加速涌现的当下,人类该如何建立真正有效的防御与治理机制?
这场论坛的核心内容,是对7月17日科学前沿论坛话题的关键延展。前天,与会专家提到了“传统外挂护栏无法阻挡AI精准越狱”的现实风险;而今天的讨论,则在此基础上进一步深入到了具体的解决路径与治理困境上。
本吉奥将焦点转向开源风险,明确指出开源权重模型一旦发布便具有不可逆性,传统的服务端监控和安全控制手段对其完全失效;周伯文从技术路径出发,提出必须从“事后修正行为”转向“安全设计与主动防御”,在模型构建之初就融入内生安全机制;薛澜则从宏观治理维度指出,虽然大规模应用至今未酿成严重灾难,但地缘政治和机制建设的局限依然明显,人类社会无法长期依赖“未发生重大事故”的现状来维系安全。
所以反复强调AI安全,是因为模型能力的增长速度与安全边界的动态平衡,已逐渐接近“临界点”。
01 风险显现:开源不可逆与防护滞后

前沿AI安全的现实危机,首先在于技术能力快速提升的同时,潜在风险也在同步扩大。
本吉奥在致辞中指出,在反映模型自主完成复杂任务能力的度量曲线上,以人类等效时间衡量,AI已能胜任长达约16小时的持续性任务,在某些关键指标上甚至呈现出指数级加速态势。
面对能力提升的现状,本吉奥领衔的国际AI安全报告给出了一个明确的结论:当前的安全防护措施虽在改进,但其提升速度始终落后于AI能力的增长,且防护手段本身仍存在诸多漏洞。
“没有任何一家开发机构能够承诺其系统不会以灾难性方式对人类造成伤害。”
在诸多风险中,本吉奥特别强调了开源权重模型带来的技术挑战。他指出,专有模型的开发者可以通过下架或发布补丁来修复漏洞,但开源权重模型则完全不同:“一旦模型权重和运行代码被公开分享,便无法撤回,因为文件会被大量复制和扩散。这种部署决策具有不可逆性……换言之,所有安全护栏皆可被轻易拆除。”
当攻击者获取完整权重和推理代码后,可以修改参数、编辑底层代码,进而移除安全约束模块,或通过微调将模型导向特定的有害目标。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| 注: | 在此页阅读全文 |
| 延伸阅读 |
推荐:
当AI自己行动,人类还安全吗?图灵奖得主谈AI安全