當AI自己行動,人類還安全嗎?圖靈獎得主談AI安全

左起依次為:上海人工智能實驗室主任周伯文、圖靈獎得主約書亞·本吉奧、清華大學教授薛瀾。
7月19日,在2026世界人工智能大會(WAIC)“前沿AI與智能體安全”論壇上,圖靈獎得主約書亞·本吉奧、上海人工智能實驗室主任周伯文、清華大學教授薛瀾等多位嘉賓,針對當前AI的發展走向與全球治理發表了見解。
他們聚焦的核心問題是,在智能體和自主提升技術加速湧現的當下,人類該如何建立真正有效的防御與治理機制?
這場論壇的核心內容,是對7月17日科學前沿論壇話題的關鍵延展。前天,與會專家提到了“傳統外掛護欄無法阻擋AI精准越獄”的現實風險;而今天的討論,則在此基礎上進壹步深入到了具體的解決路徑與治理困境上。
本吉奧將焦點轉向開源風險,明確指出開源權重模型壹旦發布便具有不可逆性,傳統的服務端監控和安全控制手段對其完全失效;周伯文從技術路徑出發,提出必須從“事後修正行為”轉向“安全設計與主動防御”,在模型構建之初就融入內生安全機制;薛瀾則從宏觀治理維度指出,雖然大規模應用至今未釀成嚴重災難,但地緣政治和機制建設的局限依然明顯,人類社會無法長期依賴“未發生重大事故”的現狀來維系安全。
所以反復強調AI安全,是因為模型能力的增長速度與安全邊界的動態平衡,已逐漸接近“臨界點”。
01 風險顯現:開源不可逆與防護滯後

前沿AI安全的現實危機,首先在於技術能力快速提升的同時,潛在風險也在同步擴大。
本吉奧在致辭中指出,在反映模型自主完成復雜任務能力的度量曲線上,以人類等效時間衡量,AI已能勝任長達約16小時的持續性任務,在某些關鍵指標上甚至呈現出指數級加速態勢。
面對能力提升的現狀,本吉奧領銜的國際AI安全報告給出了壹個明確的結論:當前的安全防護措施雖在改進,但其提升速度始終落後於AI能力的增長,且防護手段本身仍存在諸多漏洞。
“沒有任何壹家開發機構能夠承諾其系統不會以災難性方式對人類造成傷害。”
在諸多風險中,本吉奧特別強調了開源權重模型帶來的技術挑戰。他指出,專有模型的開發者可以通過下架或發布補丁來修復漏洞,但開源權重模型則完全不同:“壹旦模型權重和運行代碼被公開分享,便無法撤回,因為文件會被大量復制和擴散。這種部署決策具有不可逆性……換言之,所有安全護欄皆可被輕易拆除。”
當攻擊者獲取完整權重和推理代碼後,可以修改參數、編輯底層代碼,進而移除安全約束模塊,或通過微調將模型導向特定的有害目標。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:



