Warning: session_start(): open(/var/www/vhosts/vandaily.com/php_session/sess_ef409d2455bc25915de3075525dbe9f7, O_RDWR) failed: No space left on device (28) in /var/www/vhosts/vandaily.com/httpdocs/includes/session_new.php on line 34
圖靈獎得主警告:當前安全措施 追不上AI能力狂飆 | 溫哥華教育中心
   

圖靈獎得主警告:當前安全措施 追不上AI能力狂飆

“AI既降低了作惡的門檻,又抬高了危害的上限。”


7月17日下午,在2026世界人工智能大會(WAIC)科學前沿論壇上,圖靈獎得主約書亞·本吉奧通過遠程連線發出了上述警告。

近年來,這名富有遠瞻的“AI教父”,始終致力於應對AI帶來的安全挑戰。2025年6月,本吉奧主導的LawZero項目正致力於構建能識別並阻止AI欺騙、自我保護等有害行為的防護系統。

他領銜的國際AI安全報告也給出了壹致的結論:當前的安全措施,已經追不上AI能力狂飆的速度。

同樣站在台上的,還有上海人工智能實驗室主任、首席科學家周伯文。他沒有重復對風險的警告,而是拋出了兩個更根本的問題:AI如何從模仿已知轉向探索未知?如何確保這股力量始終可控?

兩人的演講為整場論壇定下了核心基調。

隨後,西安電子科技大學校長高新波、復旦大學副校長姜育剛、香港科技大學(廣州)協理副校長熊輝、SecureBio AI研究負責人賈斯珀·戈汀、獨立研究員傑夫·吳以及知名AI研究員索倫·明德曼,圍繞“邁向AGI時代:前沿人工智能的安全挑戰與全球治理”展開了圓桌討論。

01 外掛護欄,擋不住精准“越獄”當AI學會推理與規劃,傳統的安全護欄正在系統層面悄然失效。

西安電子科技大學校長高新波認為,傳統AI安全的護欄,本質上是壹種“補丁思維”——發現漏洞,堵上漏洞,再發現,再堵上。



高新波、熊輝等人參加AI安全與治理討論

而當模型具備了推理、規劃與工具調用能力,傳統模型變成了智能體後,這套“補丁思維”的打法便開始從根上崩潰。

失效方式可以歸納為肆種:

壹是推理能力讓AI可以理解防護的邊界,找到盲區,實施精准“越獄”;

贰是規劃能力讓AI學會戰略性欺騙,懂得在靜態或實時測試中隱藏真實意圖;

叁是工具調用的鏈條壹旦變得復雜,傳統防護系統根本無從辨別某個操作背後潛藏的語義副作用;

肆是前叁種能力相互激發,形成壹種湧現出的綜合能力,讓AI在開放環境中的行為空間幾乎趨於無限。

靠“找漏洞、打補丁”的老辦法,早已防不勝防。

對此,高新波與復旦大學副校長姜育剛不約而同地指向了同壹個概念:“內生安全”。

姜育剛用了壹個很貼切的類比。他說,人的成長靠兩條腿走路:壹是從小受的教育,把道德和法律變成心裡的“規矩”;贰是在社會上仍然需要警察和制度,來處理那些教育未能約束的行為。

對AI而言,“內生安全”就是希望它在“受教育”階段就把規則印在骨子裡,同時輔以必要的監管。當然,姜育剛也強調,指望人去監督AI的每壹步,顯然不現實,也違背了發展AI的初衷。

但壹定程度的監管必須存在,而且這種監管絕不只是人的事,也需要技術手段、評估體系和評測機制,去檢驗模型是否真正符合人的價值觀與社會期待。

順著這個思路,香港科技大學(廣州)協理副校長熊輝引入了壹個更有東方智慧的視角——道法自然。他把安全框架的演進歸納成叁個層次,“由外而內,由強制到自覺”。

第壹層是“不敢為”。通過加裝安全圍欄等外部懲罰機制形成約束,讓AI因為害怕代價而不敢越界。這是目前AI行業投入精力最多的層面。

第贰層是“不能為”。從數學底座、優化函數和系統架構層面做內置約束,讓AI從根本上沒有犯錯的能力。

第叁層是“不欲為”。讓AI在心智和邏輯層面,把道德與法律變成壹種近乎“本能”的東西,達到壹種類似“明心見性”的狀態,自己就不想做壞事。

熊輝承認,眼下AI行業在底座架構和目標函數層面的內生安全努力還遠遠不夠,技術差距依然巨大。但他同時拋出壹個構想:壹旦內核層面的安全控制得以實現,就可以把安全內核保持閉源,而外圍部分更放心地開源。

這或許會為開源模型的安全治理打開壹條全新的路徑。

02 編程能力飆升,安全能力滑坡



周伯文發表演講

安全的挑戰從來不是孤立的,它和AI的能力邊界息息相關。

周伯文在演講中揭示了壹組冷熱反差,從另壹個維度解釋了安全問題的緊迫性。

他指出,過去18個月,AI的編程成功率從5%壹路飆升到88%,以至於國外壹半的基准測試因為模型表現太強,已經失去了參考價值。

“整個行業都在感受強烈的推背感。”周伯文說。

但科學發現領域卻是另壹番景象。

艾倫研究所發布的端到端科學研究評測顯示,同壹時期,表現最好的大模型在科學任務上的完成率始終停在3%,幾乎紋絲不動。大部分模型卡在60%到70%的區間,無法獨立跑完科研全流程。



NatureBench(周伯文團隊聯合銜遠科技等發布的AI編碼智能體評測基准?)顯示:AI產出壹篇超越當前最好成果的科學論文,成功率只有17.8%。《自然》雜志的壹篇研究論文據此判斷,目前AI產出的科學工作都屬於“增量發現”,還沒有出現根本性突破。

壹邊是編程能力逼近天花板,壹邊是科研能力原地踏步。周伯文將出現這種反差的原因歸結為叁個層面:



第壹,大模型只能被動觀察世界,學到的是相關性,而不是因果性,換壹個環境就容易失靈;

第贰,科研中越有價值的問題,越難立刻知道對錯,反饋周期很長,不像編程可以秒級驗證,模型因此很難學進去;

第叁,人類發表的科研成果只有成功數據,失敗經驗幾乎從未進入訓練集,模型被鎖死在已知的分布裡,只會模仿成功路徑,走不出新路。

這組對比恰好揭示了安全治理中壹個容易被忽視的維度:當前AI的強大,主要體現在閉環任務上——編程、翻譯、下棋,都有明確的目標、即時的反饋和清晰的邊界;而真正的安全威脅恰恰來自開放任務:沒有標准答案,反饋周期漫長,失敗是常態,還要跟物理世界交互。

周伯文據此提出壹個判斷:“AGI for Science(AI4S)不是通用人工智能的應用,而是人工智能的終極考題。”

在他看來,要讓模型突破智能上限,就得主動介入世界去尋找真正的因果關系,從密集的反饋中學會處理難題,在探索失敗的過程中拓展能力的邊界。

這些要求跟安全治理的內在邏輯完全壹致。壹個不理解因果、不會從稀疏反饋中學習、只會模仿成功的AI系統,面對惡意攻擊者的創造性手段,同樣會毫無招架之力。

順著這壹思路,上海人工智能實驗室推出了“書生·端硯”科學發現平台,試圖把知識認知、邏輯推演、實驗行動與結果反饋貫通起來,形成壹套新的研究范式。其核心邏輯是,讓科學研究在真實反饋中形成閉環:結果符合預期,就沉澱為可信發現;結果反預期甚至失敗,則反過來觸發問題重構,促使研究者重新審視最初假設。



清華大學教師張數壹課題組花了4年時間改造壹種基因調控蛋白,接入“書生-端硯”後只經過兩輪迭代,AI就發現了新的突變組合,功能比此前《自然》報道的最好結果高出77%。其中壹個關鍵突變落在傳統認知中的“非功能區”,相當於AlphaGo的“神之壹手”。

這套范式背後,還有年輕博士生提出的MOBIUS架構,把知識向量和推理算子分離開來,讓模型具備了可持續成長的能力。

從安全治理的角度審視,這種將失敗納入學習閉環、追求因果理解而非統計相關的路徑,恰恰是構建內生安全所必需的技術基礎。

03 當AI學會作惡:從生物風險到證據困境在各類前沿風險中,化學、生物、放射性與核風險(統稱為CBRN)被視為最致命的領域之壹。

圖靈獎得主、“AI教父”約書亞·本吉奧在遠程致辭中發出警告:AI正從兩個方向為惡意行為者“賦能”,既降低了作惡的門檻,又抬高了危害的上限。智力本身就是力量,而AI的能力正在極速膨脹。




本吉奧發出警告

尤其在網絡安全和生物領域,開源模型壹旦發布就不可逆轉。那些具有雙重用途的能力壹旦被釋放,就無法召回,也無法修復。他強調,僅僅基於當前前沿水平來思考AI風險是遠遠不夠的。

“必須在AI模型能力躍遷之前就做好准備,而不是事後才應對,這應當成為我們的默認姿態。”

非營利組織SecureBio的AI研究負責人賈斯珀·戈汀進壹步聚焦到了生物風險上。

他提到知名AI研究員索倫·明德曼分享的壹項實地調查:在尼日利亞,前恐怖組織“博科聖地”的成員每天都在使用AI,AI不只用來制造更大的炸彈,還包括制定攻擊計劃。

更令人不安的是,他們還辦起了培訓班,教組織成員如何用AI進行恐怖活動。

戈汀指出,生物學天然具有雙重屬性,但“我們希望AI驅動的是疫苗實驗室,而不是恐怖分子的病毒學實驗室。”

研究人員在防護欄之內,應當獲得AI輔助來完成對策研發,但這些知識不應出現在開源模型裡。

獨立研究員、前OpenAI項目負責人傑夫·吳則從權力集中的角度補充了思考。他指出,前沿AI的發展伴隨著資源的集中,很可能導致權力匯聚到少數公司或機構手中。如果未來制造出遠比人類聰明的系統,人類可能面臨被全面剝奪權力的風險。

明德曼則指出壹個更深的治理困境——“證據困境”:AI能力常跳躍式提升,讓人措手不及;但真正棘手的是,在風險變成現實之前,人們很難拿到“它壹定會造成危害”的確鑿證據。

Anthropic就遇到過這種情況,模型能力突然躍升,團隊擔憂網絡攻擊風險,卻無法證明“壹定會出事”,最終自願決定暫不投放市場,才避免了潛在危害。

這正是困境所在:能力已強到令人不安,卻沒有硬證據支撐立即幹預。

04 AI威脅是炒作or真相?面對如此嚴峻的前沿風險,全球科技界在治理態度上呈現出顯著分歧。

本吉奧呼吁立即采取行動。他警告稱,在模型能力出現躍升之前做好准備,必須成為默認姿態。各國政府需要意識到,這不是某個國家單獨面對的威脅,而是AI濫用帶來的共同挑戰,必須共同預防。

相比之下,國內學者給出的回應更為務實。

高新波認為,前沿AI風險確實是基於邏輯推演的系統性威脅,但不必因此陷入末日恐慌,更不能直接叫停研究。他把前沿AI比作“比核能還要深刻的潘多拉魔盒”——打開之前,必須在工程和設計層面把“安全鎖”打造完美。

姜育剛的立場更貼近現實。他指出,呼吁停止研發在現實中根本不可能,沒人會停下來。不管各方覺得該開源還是閉源,兩種模式已經同時存在了。最務實的做法,是在新技術研發的過程中同步推進風險防控。

熊輝則堅定支持開源。他認為閉源大模型的能力越強,風險同樣在急劇增加。問題的核心不在於開不開源,而在於重構安全架構:如果能在內核層面把安全控制做到極致,外圍完全可以放心開源,讓開源的生產力紅利惠及更多人。

在具體操作層面,傑夫·吳和明德曼都提到了可落地的緩解措施。

傑夫·吳建議通過預訓練和後訓練階段的數據過濾來降低風險。明德曼補充稱,雲服務商也可以在身份核查層面設置門檻,就像進地鐵站需要出示證件壹樣,確保只有更可信的人才能獲得模型權重訪問權限。

結語討論最後,技術派把焦點放在了“可控”上。

高新波希望,AI專家不僅能造出最聰明的模型,還能提供壹套能證明、能解釋、能控制的安全防護體系;姜育剛強調,內生安全重要,但攻防技術同樣關鍵,更堅固的盾才能支撐技術持續發展;熊輝則期待安全控制能力與開發能力齊頭並進。

樂觀派把目光投向了未來。

賈斯珀·戈汀認為AI在生物學領域擁有巨大潛力,人類能找到收獲所有好處同時,也能遏制嚴重風險的方式。

制度派的思考則落在了人與人之間的協調上。

傑夫·吳和明德曼都指出,除了科學研究與風險緩解,還需要建立協調機制,在共識和監督下推進AI的開發進程。

周伯文在演講最後留下壹個判斷:“安全價值就是商業價值,它們並不對立。”

[加西網正招聘多名全職sales 待遇優]
還沒人說話啊,我想來說幾句
注:
  • 新聞來源於其它媒體,內容不代表本站立場!
  •  延伸閱讀
    賣芯片的狂賺 用芯片的虧錢!摩根大通發警告下壹步… 阿省男子BC高速上230公裡時速狂飆
    菲爾茲獎得主鄧煜談"是否回國":不存在唯壹答案 發生啥事?加拿大對美國發旅行警告
    加拿大提升警告級別 去美國警惕這種疫情 加拿大因安全隱患正召回這些窗簾
    今年的美國菲爾茲獎得主,還會表演《說唐後傳》 紅海戰火恐擴大 川普警告胡塞武裝:讓伊朗付出代價
    "沒有人是安全的":在台港人為何擔憂"跨境鎮壓"? 烏軍高層生變,媒體警告"政治危機",議員擔憂...
     推薦:

    意見

    當前評論目前還沒有任何評論,歡迎您發表您的看法。
    發表評論
    您的評論 *: 
    安全校驗碼 *:  請在此處輸入圖片中的數字
    The Captcha image  (請在此處輸入圖片中的數字)



    Copyright © 溫哥華網, all rights are reserved.

    溫哥華網為北美中文網傳媒集團旗下網站