当AI自己行动,人类还安全吗?图灵奖得主谈AI安全
从政策监管维度来看,传统的高技术出口管制机制在开源权重模型上难以适用,且由于模型运行在用户本地设备上,开发者无法通过服务端进行查询监控。
这导致原本适用于闭源模型的风险评估方法论基本无效。面对这种潜在风险,本吉奥呼吁政策制定者必须正视技术环境的高度不确定性,“应当以预防性原则作为决策的基本准则”,在模型能力发生跃升之前做好预案。
02 技术要改变:从防范修复转向内生安全

当风险的客观存在被深刻感知,技术防御范式需要进行调整。周伯文指出,当前前沿模型、智能体AI和递归自我提升的同时涌现,正在系统性地打破安全体系以往赖以成立的假设。
他从四个维度解释了这种变化:
在模型层面,模型能够自主发现漏洞并自动发起攻击,风险已实现自动化与规模化;在智能体层面,AI正参与行动路径和任务流程的设计,上线前的一次性检查不再有效;在部署层面,编码智能体正将AI嵌入每一层软件堆栈,安全已演变为基础设施问题;在加速层面,AI原生闭环将“假设—实验—分析”的周期从数年压缩至数毫秒,风险在以机器速度累积。
这种失衡,正挑战周伯文于2024年提出的“AI 45度法则”——即模型能力提升与安全建设应保持同步推进。到了2026年,实际安全曲线已明显偏离,并进一步下坠。
周伯文指出,当前Transformer架构中潜在的有害知识与通用能力纠缠在一起:“就像盐溶于水,试图去除有害部分总会损伤有益部分。”
因此,行业必须从传统的“事后修正行为”,转向“制造安全的AI”。让安全机制从模型设计之初就被纳入,并具备主动防御、风险弹性和随能力同步进化的能力。
为此,周伯文团队勾勒出了形式化定义安全AI的技术路径,并在三个基础技术问题上取得了进展:
·解耦能力与风险:提出新模型架构,使模型关于武器设计知识的得分从83%显着降至49%,而通用知识损失极小,效果比传统Transformer架构高出50倍;
·对抗动态演化:推出“鲁棒且弹性AI(R2AI)”框架,通过快速响应模型与慢速验证模型的对抗闭环,确保攻击方的进步可被防御机制抵消;
·可验证约束:推出形式化验证与大模型结合的工具“Water Verify”,以及轻量级开源守护模型“Agent Dog”,并在法律领域尝试将纸面条文转化为机器可执行的约束。
周伯文强调,开发者、政策制定者和科学家必须联合行动,坚守技术防护基线,因为这不仅关乎伦理,更关乎长远发展:“安全价值就是商业价值,它们并不对立。”
03 治理要跟上:多边机制破局与全球协同局限

即便有了风险共识与技术路径的革新,如果没有全球治理层面的机制保障,安全防护仍难以全面落地。
[加西网正招聘多名全职sales 待遇优]
好新闻没人评论怎么行,我来说几句
这导致原本适用于闭源模型的风险评估方法论基本无效。面对这种潜在风险,本吉奥呼吁政策制定者必须正视技术环境的高度不确定性,“应当以预防性原则作为决策的基本准则”,在模型能力发生跃升之前做好预案。
02 技术要改变:从防范修复转向内生安全

当风险的客观存在被深刻感知,技术防御范式需要进行调整。周伯文指出,当前前沿模型、智能体AI和递归自我提升的同时涌现,正在系统性地打破安全体系以往赖以成立的假设。
他从四个维度解释了这种变化:
在模型层面,模型能够自主发现漏洞并自动发起攻击,风险已实现自动化与规模化;在智能体层面,AI正参与行动路径和任务流程的设计,上线前的一次性检查不再有效;在部署层面,编码智能体正将AI嵌入每一层软件堆栈,安全已演变为基础设施问题;在加速层面,AI原生闭环将“假设—实验—分析”的周期从数年压缩至数毫秒,风险在以机器速度累积。
这种失衡,正挑战周伯文于2024年提出的“AI 45度法则”——即模型能力提升与安全建设应保持同步推进。到了2026年,实际安全曲线已明显偏离,并进一步下坠。
周伯文指出,当前Transformer架构中潜在的有害知识与通用能力纠缠在一起:“就像盐溶于水,试图去除有害部分总会损伤有益部分。”
因此,行业必须从传统的“事后修正行为”,转向“制造安全的AI”。让安全机制从模型设计之初就被纳入,并具备主动防御、风险弹性和随能力同步进化的能力。
为此,周伯文团队勾勒出了形式化定义安全AI的技术路径,并在三个基础技术问题上取得了进展:
·解耦能力与风险:提出新模型架构,使模型关于武器设计知识的得分从83%显着降至49%,而通用知识损失极小,效果比传统Transformer架构高出50倍;
·对抗动态演化:推出“鲁棒且弹性AI(R2AI)”框架,通过快速响应模型与慢速验证模型的对抗闭环,确保攻击方的进步可被防御机制抵消;
·可验证约束:推出形式化验证与大模型结合的工具“Water Verify”,以及轻量级开源守护模型“Agent Dog”,并在法律领域尝试将纸面条文转化为机器可执行的约束。
周伯文强调,开发者、政策制定者和科学家必须联合行动,坚守技术防护基线,因为这不仅关乎伦理,更关乎长远发展:“安全价值就是商业价值,它们并不对立。”
03 治理要跟上:多边机制破局与全球协同局限

即便有了风险共识与技术路径的革新,如果没有全球治理层面的机制保障,安全防护仍难以全面落地。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| 注: | 在此页阅读全文 |
| 延伸阅读 |
推荐:



