當AI自己行動,人類還安全嗎?圖靈獎得主談AI安全
從政策監管維度來看,傳統的高技術出口管制機制在開源權重模型上難以適用,且由於模型運行在用戶本地設備上,開發者無法通過服務端進行查詢監控。
這導致原本適用於閉源模型的風險評估方法論基本無效。面對這種潛在風險,本吉奧呼吁政策制定者必須正視技術環境的高度不確定性,“應當以預防性原則作為決策的基本准則”,在模型能力發生躍升之前做好預案。
02 技術要改變:從防范修復轉向內生安全

當風險的客觀存在被深刻感知,技術防御范式需要進行調整。周伯文指出,當前前沿模型、智能體AI和遞歸自我提升的同時湧現,正在系統性地打破安全體系以往賴以成立的假設。
他從肆個維度解釋了這種變化:
在模型層面,模型能夠自主發現漏洞並自動發起攻擊,風險已實現自動化與規模化;在智能體層面,AI正參與行動路徑和任務流程的設計,上線前的壹次性檢查不再有效;在部署層面,編碼智能體正將AI嵌入每壹層軟件堆棧,安全已演變為基礎設施問題;在加速層面,AI原生閉環將“假設—實驗—分析”的周期從數年壓縮至數毫秒,風險在以機器速度累積。
這種失衡,正挑戰周伯文於2024年提出的“AI 45度法則”——即模型能力提升與安全建設應保持同步推進。到了2026年,實際安全曲線已明顯偏離,並進壹步下墜。
周伯文指出,當前Transformer架構中潛在的有害知識與通用能力糾纏在壹起:“就像鹽溶於水,試圖去除有害部分總會損傷有益部分。”
因此,行業必須從傳統的“事後修正行為”,轉向“制造安全的AI”。讓安全機制從模型設計之初就被納入,並具備主動防御、風險彈性和隨能力同步進化的能力。
為此,周伯文團隊勾勒出了形式化定義安全AI的技術路徑,並在叁個基礎技術問題上取得了進展:
·解耦能力與風險:提出新模型架構,使模型關於武器設計知識的得分從83%顯著降至49%,而通用知識損失極小,效果比傳統Transformer架構高出50倍;
·對抗動態演化:推出“魯棒且彈性AI(R2AI)”框架,通過快速響應模型與慢速驗證模型的對抗閉環,確保攻擊方的進步可被防御機制抵消;
·可驗證約束:推出形式化驗證與大模型結合的工具“Water Verify”,以及輕量級開源守護模型“Agent Dog”,並在法律領域嘗試將紙面條文轉化為機器可執行的約束。
周伯文強調,開發者、政策制定者和科學家必須聯合行動,堅守技術防護基線,因為這不僅關乎倫理,更關乎長遠發展:“安全價值就是商業價值,它們並不對立。”
03 治理要跟上:多邊機制破局與全球協同局限

即便有了風險共識與技術路徑的革新,如果沒有全球治理層面的機制保障,安全防護仍難以全面落地。
[物價飛漲的時候 這樣省錢購物很爽]
還沒人說話啊,我想來說幾句
這導致原本適用於閉源模型的風險評估方法論基本無效。面對這種潛在風險,本吉奧呼吁政策制定者必須正視技術環境的高度不確定性,“應當以預防性原則作為決策的基本准則”,在模型能力發生躍升之前做好預案。
02 技術要改變:從防范修復轉向內生安全

當風險的客觀存在被深刻感知,技術防御范式需要進行調整。周伯文指出,當前前沿模型、智能體AI和遞歸自我提升的同時湧現,正在系統性地打破安全體系以往賴以成立的假設。
他從肆個維度解釋了這種變化:
在模型層面,模型能夠自主發現漏洞並自動發起攻擊,風險已實現自動化與規模化;在智能體層面,AI正參與行動路徑和任務流程的設計,上線前的壹次性檢查不再有效;在部署層面,編碼智能體正將AI嵌入每壹層軟件堆棧,安全已演變為基礎設施問題;在加速層面,AI原生閉環將“假設—實驗—分析”的周期從數年壓縮至數毫秒,風險在以機器速度累積。
這種失衡,正挑戰周伯文於2024年提出的“AI 45度法則”——即模型能力提升與安全建設應保持同步推進。到了2026年,實際安全曲線已明顯偏離,並進壹步下墜。
周伯文指出,當前Transformer架構中潛在的有害知識與通用能力糾纏在壹起:“就像鹽溶於水,試圖去除有害部分總會損傷有益部分。”
因此,行業必須從傳統的“事後修正行為”,轉向“制造安全的AI”。讓安全機制從模型設計之初就被納入,並具備主動防御、風險彈性和隨能力同步進化的能力。
為此,周伯文團隊勾勒出了形式化定義安全AI的技術路徑,並在叁個基礎技術問題上取得了進展:
·解耦能力與風險:提出新模型架構,使模型關於武器設計知識的得分從83%顯著降至49%,而通用知識損失極小,效果比傳統Transformer架構高出50倍;
·對抗動態演化:推出“魯棒且彈性AI(R2AI)”框架,通過快速響應模型與慢速驗證模型的對抗閉環,確保攻擊方的進步可被防御機制抵消;
·可驗證約束:推出形式化驗證與大模型結合的工具“Water Verify”,以及輕量級開源守護模型“Agent Dog”,並在法律領域嘗試將紙面條文轉化為機器可執行的約束。
周伯文強調,開發者、政策制定者和科學家必須聯合行動,堅守技術防護基線,因為這不僅關乎倫理,更關乎長遠發展:“安全價值就是商業價值,它們並不對立。”
03 治理要跟上:多邊機制破局與全球協同局限

即便有了風險共識與技術路徑的革新,如果沒有全球治理層面的機制保障,安全防護仍難以全面落地。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:



