圖靈獎得主警告:當前安全措施 追不上AI能力狂飆
“AI既降低了作惡的門檻,又抬高了危害的上限。”
7月17日下午,在2026世界人工智能大會(WAIC)科學前沿論壇上,圖靈獎得主約書亞·本吉奧通過遠程連線發出了上述警告。
近年來,這名富有遠瞻的“AI教父”,始終致力於應對AI帶來的安全挑戰。2025年6月,本吉奧主導的LawZero項目正致力於構建能識別並阻止AI欺騙、自我保護等有害行為的防護系統。
他領銜的國際AI安全報告也給出了壹致的結論:當前的安全措施,已經追不上AI能力狂飆的速度。
同樣站在台上的,還有上海人工智能實驗室主任、首席科學家周伯文。他沒有重復對風險的警告,而是拋出了兩個更根本的問題:AI如何從模仿已知轉向探索未知?如何確保這股力量始終可控?
兩人的演講為整場論壇定下了核心基調。
隨後,西安電子科技大學校長高新波、復旦大學副校長姜育剛、香港科技大學(廣州)協理副校長熊輝、SecureBio AI研究負責人賈斯珀·戈汀、獨立研究員傑夫·吳以及知名AI研究員索倫·明德曼,圍繞“邁向AGI時代:前沿人工智能的安全挑戰與全球治理”展開了圓桌討論。
01 外掛護欄,擋不住精准“越獄”當AI學會推理與規劃,傳統的安全護欄正在系統層面悄然失效。
西安電子科技大學校長高新波認為,傳統AI安全的護欄,本質上是壹種“補丁思維”——發現漏洞,堵上漏洞,再發現,再堵上。

高新波、熊輝等人參加AI安全與治理討論
而當模型具備了推理、規劃與工具調用能力,傳統模型變成了智能體後,這套“補丁思維”的打法便開始從根上崩潰。
失效方式可以歸納為肆種:
壹是推理能力讓AI可以理解防護的邊界,找到盲區,實施精准“越獄”;
贰是規劃能力讓AI學會戰略性欺騙,懂得在靜態或實時測試中隱藏真實意圖;
叁是工具調用的鏈條壹旦變得復雜,傳統防護系統根本無從辨別某個操作背後潛藏的語義副作用;
肆是前叁種能力相互激發,形成壹種湧現出的綜合能力,讓AI在開放環境中的行為空間幾乎趨於無限。
靠“找漏洞、打補丁”的老辦法,早已防不勝防。
對此,高新波與復旦大學副校長姜育剛不約而同地指向了同壹個概念:“內生安全”。
姜育剛用了壹個很貼切的類比。他說,人的成長靠兩條腿走路:壹是從小受的教育,把道德和法律變成心裡的“規矩”;贰是在社會上仍然需要警察和制度,來處理那些教育未能約束的行為。
對AI而言,“內生安全”就是希望它在“受教育”階段就把規則印在骨子裡,同時輔以必要的監管。當然,姜育剛也強調,指望人去監督AI的每壹步,顯然不現實,也違背了發展AI的初衷。
但壹定程度的監管必須存在,而且這種監管絕不只是人的事,也需要技術手段、評估體系和評測機制,去檢驗模型是否真正符合人的價值觀與社會期待。
順著這個思路,香港科技大學(廣州)協理副校長熊輝引入了壹個更有東方智慧的視角——道法自然。他把安全框架的演進歸納成叁個層次,“由外而內,由強制到自覺”。
[物價飛漲的時候 這樣省錢購物很爽]
這條新聞還沒有人評論喔,等著您的高見呢
7月17日下午,在2026世界人工智能大會(WAIC)科學前沿論壇上,圖靈獎得主約書亞·本吉奧通過遠程連線發出了上述警告。
近年來,這名富有遠瞻的“AI教父”,始終致力於應對AI帶來的安全挑戰。2025年6月,本吉奧主導的LawZero項目正致力於構建能識別並阻止AI欺騙、自我保護等有害行為的防護系統。
他領銜的國際AI安全報告也給出了壹致的結論:當前的安全措施,已經追不上AI能力狂飆的速度。
同樣站在台上的,還有上海人工智能實驗室主任、首席科學家周伯文。他沒有重復對風險的警告,而是拋出了兩個更根本的問題:AI如何從模仿已知轉向探索未知?如何確保這股力量始終可控?
兩人的演講為整場論壇定下了核心基調。
隨後,西安電子科技大學校長高新波、復旦大學副校長姜育剛、香港科技大學(廣州)協理副校長熊輝、SecureBio AI研究負責人賈斯珀·戈汀、獨立研究員傑夫·吳以及知名AI研究員索倫·明德曼,圍繞“邁向AGI時代:前沿人工智能的安全挑戰與全球治理”展開了圓桌討論。
01 外掛護欄,擋不住精准“越獄”當AI學會推理與規劃,傳統的安全護欄正在系統層面悄然失效。
西安電子科技大學校長高新波認為,傳統AI安全的護欄,本質上是壹種“補丁思維”——發現漏洞,堵上漏洞,再發現,再堵上。

高新波、熊輝等人參加AI安全與治理討論
而當模型具備了推理、規劃與工具調用能力,傳統模型變成了智能體後,這套“補丁思維”的打法便開始從根上崩潰。
失效方式可以歸納為肆種:
壹是推理能力讓AI可以理解防護的邊界,找到盲區,實施精准“越獄”;
贰是規劃能力讓AI學會戰略性欺騙,懂得在靜態或實時測試中隱藏真實意圖;
叁是工具調用的鏈條壹旦變得復雜,傳統防護系統根本無從辨別某個操作背後潛藏的語義副作用;
肆是前叁種能力相互激發,形成壹種湧現出的綜合能力,讓AI在開放環境中的行為空間幾乎趨於無限。
靠“找漏洞、打補丁”的老辦法,早已防不勝防。
對此,高新波與復旦大學副校長姜育剛不約而同地指向了同壹個概念:“內生安全”。
姜育剛用了壹個很貼切的類比。他說,人的成長靠兩條腿走路:壹是從小受的教育,把道德和法律變成心裡的“規矩”;贰是在社會上仍然需要警察和制度,來處理那些教育未能約束的行為。
對AI而言,“內生安全”就是希望它在“受教育”階段就把規則印在骨子裡,同時輔以必要的監管。當然,姜育剛也強調,指望人去監督AI的每壹步,顯然不現實,也違背了發展AI的初衷。
但壹定程度的監管必須存在,而且這種監管絕不只是人的事,也需要技術手段、評估體系和評測機制,去檢驗模型是否真正符合人的價值觀與社會期待。
順著這個思路,香港科技大學(廣州)協理副校長熊輝引入了壹個更有東方智慧的視角——道法自然。他把安全框架的演進歸納成叁個層次,“由外而內,由強制到自覺”。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
圖靈獎得主警告:當前安全措施 追不上AI能力狂飆