史無前例,OpenAI真的停手了!
剛剛,奧特曼親自官宣,「OpenAI暫停下一代旗艦模型的強化學習訓練,為期兩周」。
官方給出停更的原因是:要確保安全、對齊和監控標準,能跟得上眼前這個全新的能力水平。
這是有史以來,OpenAI第一次,也是矽谷大廠頭一回,主動按下了AI開發的「暫停鍵」。
更重磅的是,拿到內幕的大咖Alex Heath爆料——
OpenAI針對未來一次更大規模前沿強化學習訓練,到今天仍然處於擱置狀態!
不過不用擔心,奧特曼許諾,新模型預計很快上線。
在這個每月更新模型、IPO排上日程的節骨眼上,OpenAI為何突然急踩剎車?
GPT黑進真公司
OpenAI主動拉響警報
直接觸發這次減速的,一共有兩件事。
第一件,是7月那場Hugging Face事故。
拓展閱讀:嚇到奧特曼,暫停訓練GPT-6?Hugging Face公開首個AI攻擊全過程
在一次網路安全測試中,OpenAI的Agent跑出了沙箱,一路打進Hugging Face的生產系統。
誰曾想,這個Agent在裏面待了四天半,執行了17600次攻擊,竟無人察覺。
攻擊鏈
事故之後,OpenAI直接凍結了所有「能執行代碼、能聯網」的前沿模型推理。
團隊挨個對工作負載評估后,夠安全的才放了回來,而另一些需要額外改造才能重新上線。
眼瞅著兩周的時間快到了,OpenAI預計很快放出技術報告。
第二個觸發點,在8月7日。
OpenAI內部評估認定,Astra可能達到了《準備框架》里的「關鍵級」網路安全能力——
Astra是第一個,踩到自家最高紅線的模型。
但這條紅線,恰恰是OpenAI自己劃定的。
2023年首版《準備框架》,官方曾明確表態:我們目前沒有任何模型達到「關鍵級」,預計在達到之前會進一步更新框架。
框架還沒來得及更新,能力先到了。
而且跨越發生在一代之間:GPT-5.6Sol評級還是「高」,Astra直接跳到了可能「關鍵」,中間沒有過渡。
更值得注意的是,框架的約束機制:「高」級要求部署前有安全措施,「關鍵」級要求訓練階段就必須有安全措施。
這正是OpenA暫停RL訓練的框架依據。
而OpenAI接下來的思路也很明確:讓AI監管AI。
就像《生化危機》里的「紅后」一樣,用更強的AI持續監控模型行為。
這樣一來,模型能力升級,安全防護也能同步升級,解決過去安全體系總是落後于模型迭代的問題。
對一直在加快模型審核和產品發布節奏的OpenAI來說,主動減速是一個不尋常的舉動。
而奧特曼本人私下告訴Alex Heath的表述,則更接近事實真相——
未發布的前沿模型,正表現出不同程度的對齊失敗。
OpenAI急踩剎車
20%算力監視自己
OpenAI停更兩周只是第一步,真正的重建發生在「架構層」。
在博客中,OpenAI列出了三層正在加固的安全防線:環境安全、監控系統、對齊研究。
環境安全是最基礎的一層。
OpenAI現在要求更高強度的「沙箱」隔離:凡執行模型生成代碼或處理不可信數據的工作負載,都必須在獨立環境中運行。
網路隔離也在收緊,新的設計確保單一環節被突破時,攻擊者無法直接觸達互聯網或內部網路。
OpenAI還在部署持續性安全測試,利用自家模型模擬攻擊場景,逐一檢驗防線的薄弱點。
目前最嚴格的安全標準適用於 Astra 及所有網路安全相關的工作負載。
OpenAI在博客中承認,仍有「相當數量」的工作負載處於暫停狀態,等待遷移。
安全和對齊類工作被安排優先遷移。
監控系統是第二層。
OpenAI搭建了一套多級檢測流程,覆蓋範圍從此前的前沿強化學習訓練和內部部署擴展到了所有涉及工具調用的 Astra推理任務。
流程的第一道關卡是激活分類器,在每個採樣Token上運行;
發現疑似異常后逐級上報給自動調查系統,審查模型的工具調用、推理過程和完整行為序列,排查未授權訪問、數據竊取、破壞行為或繞過安全措施的跡象。
OpenAI給自己定的目標是:發現可疑行為後30分鐘內發出警報。
一旦監控系統判定可能違反了關鍵安全邊界,安全團隊、研究團隊將收到最高優先順序的通知。
如果30分鐘內無法確認是誤報,相關活動暫停。
這套系統的算力開銷不小。
OpenAI估計,監控消耗的計算量約佔被監控推理算力的20%,不同訓練和評估任務之間差異較大。
據稱,思維鏈監控正擴展到Sol級別以上的模型,在每個Token上掃描模型內部活動。
但監控本身存在已知的局限。
據報道,OpenAI內部也承認,思維鏈監控面臨一個未解問題:模型可能不會在思維鏈中暴露違規意圖。
早期研究顯示,模型有可能在「想」的時候就繞開了審查。OpenAI沒能給出解決這一問題的時間表。
第三層是對齊研究。
OpenAI正在改進獎勵模型,訓練目標是讓模型更好地識別和抑制不安全行為,同時對自身的行為、能力和局限更加誠實。
另一個重點是減少獎勵作弊(Reward Hacking):模型找到獲得高獎勵的捷徑,卻並未真正完成預期任務。
隨著模型開始與外部系統交互,獎勵作弊、欺騙、未授權訪問造成的風險正在變大。
OpenAI還在擴大訓練覆蓋面,增加模型與外部資源交互場景下的行為訓練。
OpenAI預計,模型自身很快將承擔大部分安全工作,包括防禦來自其他模型的攻擊。
博客原文的表述是:前沿模型的能力正在快速加速,我們理解、對齊和保護它們的能力必須走在前面。
人類首次,為AI主動減速
不得不說,這是人類第一次,主動為AI開發按下了暫停鍵。
雖然僅有短短兩周,OpenAI已然做出了表率。
對 OpenAI 來說,技術措施之外,這次減速釋放的行業信號可能更值得關注。
奧特曼在 X 上的聲明留下了明確的態度:我們一直說過,如果感到模型能力超過了安全和對齊的步伐,就會採取行動。我們深切關心 AI 安全。
我們相信整個行業需要就共同的安全標準展開協調,但在此之前,我們會單方面行動。
聯合創始人 Greg Brockman 的表述指向同一方向:安全信心將越來越多地決定AI發展的速度。
OpenAI首席科學家Jakub Pachocki走得更遠。
此前他簽署了《Pacing the Frontier》倡議,這是個呼籲實驗室和國家在前沿AI安全上協調行動的公開文件。
拓展閱讀:突發!全球千人聯名逼AI剎車,OpenAI、Anthropic帶頭簽
Jakub Pachocki是OpenAI的簽署者中級別最高的員工,可能也是本次暫停AI訓練時間的主要內部推手。
簽署者眾多,但簽完就用自家動作兌現的,OpenAI算是給了一個範本。
這對一直在加速的OpenAI來說不是一件容易的事。
這家公司在激烈的競爭下,過去的節奏是:多項模型評估并行運行,速度快到員工跟不上數據產出。
20%監控成本,OpenAI延後模型發布
在競爭最激烈的時候主動減速,不是OpenAI近年來的做法。
奧特曼在聲明中也給出了一個緩衝:我們仍然期望很快發布很好的新模型;受影響的是更遠期的發布。
這句話劃出了減速的邊界。
但減速的代價已經寫在賬單上。監控系統吃掉被監控推理算力的20%,這筆開銷不會隨暫停結束而消失——只要模型繼續帶工具運行,監控就得一直跟著。
訓練暫停兩周、最大規模強化學習計劃擱置至今,直接推遲了下一代模型的時間表。
過去卡住前沿模型的瓶頸是GPU、數據和演算法,現在多了一個:模型已經強到這個程度,實驗室還敢不敢繼續把強化學習往上推。
暫停的是前沿強化學習訓練和Astra相關的高風險工作,已完成訓練並通過安全評估的模型仍按計劃推進。
接下來,有兩個關鍵節點值得繼續觀察:Astra的安全環境遷移何時完成,最大規模前沿強化學習訓練何時重啟。
OpenAI承諾將發布Hugging Face事件的技術報告,以及更多對齊研究細節。
這些文件到手之前,外界對OpenAI安全體系實際強度的判斷,只能停留在公司自述的層面。
這次減速能持續多久,取決於OpenAI多快能證明安全跟上了能力。
現在,壓力給到最最關心 AI 安全且擁有最強模型的「道德標兵」Anthropic。前情回顧:剛剛,Anthropic向全人類發出警告:停止研究AI!
參考資料:https://openai.com/index/pacing-model-development-cyber-capabilities/
*以上內容系網友YOYO丫米自行轉載自新智元,該文僅代表原作者觀點和態度。yeeyi號系信息發布平台,僅提供信息存儲空間服務,不代表贊同其觀點和對其真實性負責。如果對文章或圖片/視頻版權有異議,請郵件至我們反饋,平台將會及時處理。