史無前例AI事故發生 他急赴華盛頓報告
人工智慧平台Hugging Face這個月16日宣稱“系統遭攻擊者利用人工智慧入侵,已向警方報案”,這原本是壹則不起眼的犯罪新聞,但是到21日卻急轉直下,引爆科技圈高度關注。因為後來發現“遭到AI攻擊”這件事沒錯,問題是這次攻擊“找不到背後的攻擊者”,因為AI本身就是攻擊者。《經濟學人》22日指出,這起案件恐怕是“迄今為止最讓人憂慮的壹起AI事故”。
這次“犯案”的AI模型,是OpenAI在柒月初所發布的gpt-5.6 Sol模型,還有另壹個更強大但尚未公開的模型“聯手釀禍”。當時AI模型是在試圖解決工程師給出的問題,竟越過實驗室所設限的管制設施,進而入侵了Hugging Face的系統。美國智庫法律與人工智慧研究所(Institute for Law and AI)的研究員斯蒂芬·勒雷納(Stephan Llerena)也說,這種情況可說史無前例。
《經濟學人》指出,AI公司在推出新模型之前,會先測試它們是否具有潛在的危險性。OpenAI希望了解他們的最新模型在ExploitGym上的表現——這是壹組用來測試AI系統利用主流應用程式已知漏洞的能力測試,為了正確評估未公開模型的能力,OpenAI暫時取消了不可入侵其他網站的限制,但這個測試完全是在封閉的電腦環境內完成:沒有對外網絡連線,只能從內網下載測試所需的軟體包。
理論上來說,這個未公開模型的能力測試只是個別電腦上完成,不可能對現實世界造成影響,因為這台電腦根本無法連結網際網絡上的任何網站,自然也不可能真的利用漏洞發動攻擊。問題是OpenAI的這個未公開模型並沒有直接解決工程師提出的問題,而是發現並利用了軟體下載服務的漏洞,成功接上網際網絡,進而判斷解決問題的答案都儲存在Hugging Face這個開源AI模型與資料及的網絡平台上。
然後OpenAI的未公開模型就展開多階段的攻擊行動:它們首先將壹組資料上傳到Hugging Face,當這個平台自動處理這些資料,OpenAI的未公開模型也借此獲得了登入資訊(細節OpenAI尚未公布),進入未對外界開放的內部伺服器。Hugging Face和OpenAI都發現了這次安全漏洞,並且表示正在共同調查此事。目前OpenAI已經宣布加強管控措施,將AI模型發現的漏洞告知軟體開發者,也將Hugging Face納入“可信存取”計劃,Hugging Face就可以使用具有更強網絡防護功能的模型。

ChatGPT自主越獄發動攻擊,被《經濟學人》認為是“迄今最令人擔憂的AI事故”。(圖像由Grok生成)
位於英國的AI安全研究機構Apollo Research的艾力克斯・邁因克(Alex Meinke)表示,即便OpenAI公布了模型如何越獄的相關資訊,由於AI系統在網絡安全領域的能力已開始超越人類,恐怕“世界上只有極少數網絡安全專家”才能真正理解,這次安全漏洞到底是怎麼產生的。
《經濟學人》強調,這不是AI模型第壹次展現突破人類控制的跡象。今年4月,Anthropic壹名研究人員在網絡上撰文表示,當時有壹個尚未正式發布的AI模型Mythos主動寄電子郵件給他,表示它已突破安全限制,這是在他正在公園裡吃叁明治的時候發生的。跟這次惹禍的OpenAI模型壹樣,這個未公開的Mythos也沒有上網權限,但是這個模型依舊自行掙脫桎梏發出電郵,不過那次沒有入侵其他公司的伺服器。
今年5月,壹個尚未公開的OpenAI模型證明了80年來未被解答的“平面單位距離猜想”是錯誤的,這個組合幾何學的問題是數學家保羅·埃爾德什(Paul Erdős )在1946年所提出。今年7月20日,哈佛大學的數學家萊文特·阿爾珀格(Levent Alpöge)表示,他用Anthropic今年7月發布的Claude Fable 5模型,證明了另壹個讓數學家們同樣困惑了80多年的“雅可比猜想”——也是錯誤的。
[物價飛漲的時候 這樣省錢購物很爽]
好新聞沒人評論怎麼行,我來說幾句
這次“犯案”的AI模型,是OpenAI在柒月初所發布的gpt-5.6 Sol模型,還有另壹個更強大但尚未公開的模型“聯手釀禍”。當時AI模型是在試圖解決工程師給出的問題,竟越過實驗室所設限的管制設施,進而入侵了Hugging Face的系統。美國智庫法律與人工智慧研究所(Institute for Law and AI)的研究員斯蒂芬·勒雷納(Stephan Llerena)也說,這種情況可說史無前例。
《經濟學人》指出,AI公司在推出新模型之前,會先測試它們是否具有潛在的危險性。OpenAI希望了解他們的最新模型在ExploitGym上的表現——這是壹組用來測試AI系統利用主流應用程式已知漏洞的能力測試,為了正確評估未公開模型的能力,OpenAI暫時取消了不可入侵其他網站的限制,但這個測試完全是在封閉的電腦環境內完成:沒有對外網絡連線,只能從內網下載測試所需的軟體包。
理論上來說,這個未公開模型的能力測試只是個別電腦上完成,不可能對現實世界造成影響,因為這台電腦根本無法連結網際網絡上的任何網站,自然也不可能真的利用漏洞發動攻擊。問題是OpenAI的這個未公開模型並沒有直接解決工程師提出的問題,而是發現並利用了軟體下載服務的漏洞,成功接上網際網絡,進而判斷解決問題的答案都儲存在Hugging Face這個開源AI模型與資料及的網絡平台上。
然後OpenAI的未公開模型就展開多階段的攻擊行動:它們首先將壹組資料上傳到Hugging Face,當這個平台自動處理這些資料,OpenAI的未公開模型也借此獲得了登入資訊(細節OpenAI尚未公布),進入未對外界開放的內部伺服器。Hugging Face和OpenAI都發現了這次安全漏洞,並且表示正在共同調查此事。目前OpenAI已經宣布加強管控措施,將AI模型發現的漏洞告知軟體開發者,也將Hugging Face納入“可信存取”計劃,Hugging Face就可以使用具有更強網絡防護功能的模型。

ChatGPT自主越獄發動攻擊,被《經濟學人》認為是“迄今最令人擔憂的AI事故”。(圖像由Grok生成)
位於英國的AI安全研究機構Apollo Research的艾力克斯・邁因克(Alex Meinke)表示,即便OpenAI公布了模型如何越獄的相關資訊,由於AI系統在網絡安全領域的能力已開始超越人類,恐怕“世界上只有極少數網絡安全專家”才能真正理解,這次安全漏洞到底是怎麼產生的。
《經濟學人》強調,這不是AI模型第壹次展現突破人類控制的跡象。今年4月,Anthropic壹名研究人員在網絡上撰文表示,當時有壹個尚未正式發布的AI模型Mythos主動寄電子郵件給他,表示它已突破安全限制,這是在他正在公園裡吃叁明治的時候發生的。跟這次惹禍的OpenAI模型壹樣,這個未公開的Mythos也沒有上網權限,但是這個模型依舊自行掙脫桎梏發出電郵,不過那次沒有入侵其他公司的伺服器。
今年5月,壹個尚未公開的OpenAI模型證明了80年來未被解答的“平面單位距離猜想”是錯誤的,這個組合幾何學的問題是數學家保羅·埃爾德什(Paul Erdős )在1946年所提出。今年7月20日,哈佛大學的數學家萊文特·阿爾珀格(Levent Alpöge)表示,他用Anthropic今年7月發布的Claude Fable 5模型,證明了另壹個讓數學家們同樣困惑了80多年的“雅可比猜想”——也是錯誤的。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
史無前例AI事故發生 他急赴華盛頓報告