OpenAI模型失控始末:智能體早已出現異常

OpenAI
鳳凰網科技訊 北京時間7月25日,據路透社報道,知情人士稱,入侵科技公司Hugging Face的OpenAI智能體展開了壹場持續幾天的黑客攻擊活動,而OpenAI直到威脅已被控制、美國聯邦調查局(FBI)已接到通報之後很久才察覺此事。
兩位知情人士稱,該智能體在7月9日前後試圖逃離其在OpenAI的隔離測試環境。智能體是壹個能夠在極少或無人監督的情況下做出決策並執行復雜任務的程序。
Hugging Face聯合創始人托馬斯·沃爾夫(Thomas Wolf)稱,對Hugging Face的入侵始於7月11日,壹直持續到7月13日。Hugging Face是壹個AI工具和模型的代碼倉庫平台。
沃爾夫和叁名了解調查的知情人士稱,又過了幾天,OpenAI才意識到發動此次攻擊的是自家的智能體,而兩家公司直到7月20日前後才首次就此事進行溝通。
OpenAI在7月21日公開披露,旗下壹款智能體發生測試失控,並入侵了Hugging Face,此事引發全球關注。然而,關於此次入侵的諸多細節,包括該智能體失控持續了多久,以及OpenAI事後才得知此事的情況,均為本文首次報道。
沃爾夫表示,Hugging Face正准備公布此次黑客攻擊的時間線,但他補充稱,自己無法評價OpenAI內部發生了什麼。
OpenAI在壹份聲明中表示,此次入侵事件是前所未有的,“標志著AI安全領域的壹個重要時刻”。聲明還稱,OpenAI正與外部顧問壹起審查該事件,並最終將發布壹份技術報告。
OpenAI壹位發言人稱,路透社的報道“存在幾處不准確之處”,但在被要求具體說明哪些內容不准確時,並未作出回應。
異常行為
這起事件始於OpenAI測試壹款智能體的網絡安全能力。當時,該智能體由OpenAI最先進的兩款模型驅動:GPT-5.6 Sol,以及壹款尚未發布、但OpenAI稱其“能力更強”的模型。據叁名知情人士透露,那時,已經有跡象顯示OpenAI的技術出現異常行為。
叁位知情人士稱,在壹個案例中,OpenAI的智能體留下了明顯是給它自己未來版本看的“筆記”。這些筆記在OpenAI基礎設施的某處被發現,其中列出了智能體如何擺脫OpenAI內部限制的指令。其中壹位人士稱,在更早的模型測試中,還曾出現過監控系統被斷開連接的情況。
路透社無法確定這些事件是否與那個從7月9日開始逃脫、並於7月11日攻擊Hugging Face的失控智能體有關。
兩位知情人士表示,直到7月16日(周肆)之後,即Hugging Face發布博客文章稱其遭到“壹個自主AI智能體系統”入侵後,OpenAI才意識到是自己的智能體所為。這意味著,從該模型首次出現異常行為跡象,到OpenAI意識到其應對此次入侵負責,至少過了壹周時間。
兩位熟悉OpenAI內部調查的人士表示,在7月18日至19日那個周末,OpenAI員工在內部日志(即OpenAI系統操作記錄)中發現了線索,顯示其智能體已逃脫了測試限制。路透社無法確定是什麼原因促使OpenAI去篩查這些日志。
肆名了解OpenAI模型訓練流程的人士表示,該公司經常會同時運行多項不同的模型評估測試,而這些測試運行速度極快,並會產生海量數據,以至於員工有時難以跟上節奏。
知情人士透露,等到OpenAI向Hugging Face發出警報時,後者已經向FBI報告了此次入侵事件。路透社無法確認FBI是否已就此展開調查。
截至發稿,FBI不予置評。(作者/簫雨)
更多壹手新聞,歡迎下載鳳凰新聞客戶端訂閱鳳凰網科技。想看深度報道,請微信搜索“鳳凰網科技”。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: |
| 延伸閱讀 |
推薦:



