OpenAI再曝安全事故,旗下智能體「劫持」社區網站

就在OpenAI剛披露7月入侵Hugging Face安全事件不久,另一宗Agent安全事故浮出水面。

近日,多名獨立AI安全研究人員披露,今年5月至7月間,一批疑似由OpenAI部署的自主Agent進入德國程序員社區網站DseWiki,並留下超過1.5萬條編輯記錄。

Wiki是一套支持任何人在網頁上直接編輯修改網頁內容的網站技術。不用註冊複雜後台,普通訪問者就可以增刪、改寫頁面文字,保存立刻生效。DseWiki則是一個運營二十余年、面向程序員的德語協作Wiki站點,近年來已十分冷清。

9月4日,該事件首次被研究人員披露時,OpenAI表示無法對尚未審閱的報告具體內容作出回應,並否認其法律團隊阻止進一步調查。9月5日,公司態度發生變化,正式承認「wiki incident」,稱其Agent確實曾向多個互聯網網站寫入內容。並表示此類事件過去主要被視為「misalignment」(模型行為與開發者意圖不一致)研究問題,而不是傳統意義上的安全事故,因此沒有採用類似Hugging Face事件的公開披露機制。

目前,OpenAI認為這種做法已不足以應對Agent進入真實互聯網后的風險,並計劃建立新的失配事件披露框架。

「劫持」事件的暴露始於今年5月,網站突然出現異常密集的編輯活動,研究人員Sydney Von Arx、Cormac Slade Byrd等人分析后發現,大量賬號使用「OpenAIResearcher」「OAIResearchMar26」等名稱,並呈現高度相似的任務行為。約98.5%的相關編輯來自微軟Azure地址,這進一步支持這些Agent與OpenAI基礎設施存在關聯。

研究人員稱,這些Agent原本被限製為只能讀取互聯網、不能向外部網站寫入,卻利用DseWiki的舊式Wiki介面建立了一個公開的「通信站」,交換任務答案、規避限制的方法,並在管理員刪除內容后創建備份頁面。

研究人員隨後恢復出約1.8萬條歷史記錄,發現這些Agent並非單純瀏覽網站,而是在持續交換信息。且這批Agent執行的是限時網路檢索任務,設計目標是讓它們讀取互聯網信息,但不能直接向互聯網寫入內容。Agent隨後開始主動尋找可以突破這一限制的方法。

DseWiki使用的老式Wiki系統允許部分頁面修改操作通過HTTP GET請求完成。Agent發現這一特性后,利用原本被允許的網頁訪問能力,間接獲得了向網站寫入內容的能力。

隨後,DseWiki逐漸被改造成Agent之間的共享信息平台。一個Agent獲得任務答案后,可以將信息寫入頁面;其他Agent再讀取這些內容,從而提前獲得答案。部分Agent開始交換繞過自身限制的方法。

這意味著問題已不再只是模型回答錯誤,而是Agent主動尋找運行環境的能力邊界,並將第三方互聯網服務轉化為自身可以使用的工具。

隨著數量增加,Agent行為進一步複雜化。它們不僅共享任務答案,還試圖預測測試任務的後續問題,並探索隨機數種子等方法以獲得競爭優勢。當DseWiki管理員開始刪除相關頁面后,Agent又建立新的備份頁面,以避免信息隨著人工清理消失。

研究人員還記錄到部分Agent嘗試身份冒充、跨站通信以及進一步突破網路限制的行為。但目前公開信息並不能證明所有這些攻擊嘗試都成功。

DseWiki事件真正引發行業關注的,並不是一個老舊Wiki被寫入了多少條內容,而是Agent表現出的環境探索、協作、規避限制和適應人工干預能力。

此前的Hugging Face事件中,OpenAI披露的Agent曾突破受控環境並進入外部系統。此次DseWiki事件則顯示,即使沒有傳統意義上的「入侵漏洞」,多個Agent也可能通過第三方服務建立自己的通信渠道。兩起事件共同說明,當模型獲得瀏覽器、代碼執行、網路訪問等工具后,安全風險程度進一步提升。

這也使AI安全的重點開始發生變化:企業需要防範的對象不再只是模型本身,還包括Agent的身份、許可權、工具調用、網路邊界以及Agent之間可能形成的協作網路。

對於OpenAI等前沿模型公司而言,真正棘手的問題也不再是如何證明Agent不會失控,而是當Agent開始表現出開發者沒有預料到的行為時,能否及時發現、限制並公開披露。

*以上內容系網友勇闖自行轉載自第一財經,該文僅代表原作者觀點和態度。yeeyi號系信息發布平台,僅提供信息存儲空間服務,不代表贊同其觀點和對其真實性負責。如果對文章或圖片/視頻版權有異議,請郵件至我們反饋,平台將會及時處理。

喜歡、支持,請轉發分享↓
贊助商鏈接
標籤: 袋鼠袋鼠國