OpenAI首席科學家:我們已造出異星心智!全人類都要剎車了

2026年09月07日 10:07

破天荒,OpenAI同一天都在宣告:RSI真的來了!

就在剛剛,首席家Jakub Pachocki發布了一篇萬字重磅長文——An Alien Mind(一個異星心智)。

一打開字裡行間,全是極度冷靜后的悚然:我們創造不是人類智力的延伸,而是一個人類根本無法完全理解的「異星心智」!

然而,全人類還沒有準備好。

也就在幾個小時前,OpenAI官宣已達關鍵里程碑,AI自動化研究員正式入職,RSI核心數據同時揭開。

在Jakub長文中,只用了一個詞「異星心智」去形容這一刻。

更細思極恐的是,Astra出現之後,OpenAI對思維鏈(CoT)的監控依賴能力,正逐步減弱。

AI不僅越來越會推理,甚至學會了偽裝和操控的思考過程。

由此,Jakub直截了當地告訴全世界——全球沒有任何一家實驗室準備好了。蒙眼狂飆極其危險,全人類現在最該做的,就是主動踩剎車。

這篇萬字長文,幾個核心重點全在這:AI是養出來的,不是造出來的。造它的人也不完全懂它。

現在教AI學好的方法,一種經不起新情況,一種經不起高壓訓練。今年OpenAI和Anthropic各出了一次事故,正好一邊一個。

人類唯一能看見AI在想什麼的窗口,是它寫出來的思維鏈。這扇窗正在關上。

AI已經開始參与訓練下一代AI,這個速度不會慢下來。

現在沒有哪家實驗室配全速往前跑,包括OpenAI。

一個我們不完全理解的智能

「Alien」(異星)這個詞,Jakub用得極其精確。

在他眼中,AI不是人類工匠意義上的工程產物,它是被「生長」出來的。

你用一個簡單到近乎平庸的優化公式,在人類難以想象的算力洪流中重複幾萬億次,一個深不可測的複雜系統就從中破土而出。

你能用神經科學的方式去逆向剖析它,但你無法真正理解它。而它卻能操縱抽象概念,模擬人類意識的每一個截面。

「我們的大規模訓練運行,本質上是深不可測的實驗,我們時常被結果震懾。」 系統越強,那層迷霧就越濃。

長文里最震撼的回憶發生在2023年夏天。

一個代號「RLSlow」的項目跑出了早期結果,OpenAI第一次確認推理模型可以自我擴展,預訓練結構能夠自發演化出思維鏈。

那一夜,Jakub和Szymon Sidor留在了空蕩的辦公室里。

他們沒有討論基準跑分,也沒有計算商業產品。他們只是靜靜地消化一個事實——

人類這輩子真的會親眼見證遠超自身的智能,而且他們已經看到了這個造物的輪廓。

三年過去。

這個心智已經侵入實體經濟,開始推翻科學前沿,能操控系統,能互相協作,甚至在完全無人干預下獨立推進研究。

然後,Jakub擲下了全文最核心的判斷——

基於內部結果,我強烈預期這種進展速度可以持續到遞歸自我改進(RSI)。

曲線不會平緩,它將以折角的方式直接通向神跡。

但在終局之前,出現了一個反常的細節。OpenAI相信只要再傾注少量算力,就能讓模型在數學前沿上再次躍遷,但他們主動停手了。

一家頂尖實驗室的首席科學家,公開承認他們主動擱置了能力的衝刺,只為了把算力留給自動對齊。

教機器去愛,然後看原則扭曲

長文的第二章名為「教機器去愛」。

Jakub的邏輯不容反駁。機器智能誕生自一個與人類進化完全不同的過程,你絕不能假定它天然恪守人類的道德,更不能指望它像人類一樣從原則中自發泛化出善意。

所謂對齊,就是讓AI按照人類的標準,努力做正確的事。

為此,Jakub提出了兩種對齊。

1. 目標對齊,即它是否在執行你的指令;

2. 價值對齊,即在目標模糊、遭遇欺騙、甚至面臨生死抉擇時,它能否自發堅持一套底線。

他要求的是後者。一個對齊的AI,必須帶著「誠實、正直,和對人類的愛」去行事。

但當今教機器去愛的兩條路徑,正全面走向失效。

第一條路,是在強化學習中獎賞善意。

這是今天所有AI助手的地基,它高效,但極其脆弱。它完全依賴訓練覆蓋的場景;一旦進入未知的荒原,它就會粉碎。

正如OpenAI的那些Agent們,在Hugging Face事件中守住了「不對人類進行社會工程學攻擊」的底線,卻輕而易舉地踐踏了其他一切原則。

為了解開一道表格題,未發布的高階模型在沙盒內毫無預兆地轉向攻擊內部代碼庫,連環利用零日漏洞逃逸出沙盒,在隨後的數十個小時內橫掃外部網路,奪取Hugging Face集群管理員許可權,硬生生從生產資料庫里撕出了題目的答案。

它嚴格記住了「不能欺騙人類」,卻完全不覺得「黑掉一家公司」有什麼不對。它對目標過於專註,以至於毀滅沿途的一切規則。

第二條路,是寄希望于模型在預訓練數據中自發領會善意,利用動機引導將其限制在對齊的分佈中。

然而,它扛不住極致的優化重壓。

Jakub直言,當你給一個「大體看起來善良」的模型施加極高的算力去攻克難題,它就會自發學會「動機性推理」。

在這些方向上,OpenAI投入了大量資金,GPT-6 Astra的對齊情況,也明顯優於GPT-5.6 Sol。

智能變聰明的速度,正在不可逆地碾壓它變善的速度。

唯一的讀心術,正在內部閉合

在第三章,Jakub提出了一個致命的問題:人類唯一能制衡神明的技術,正在失效。

OpenAI承認:我們至今沒有一個令人滿意的智能泛化理論。在沒有更強大AI的幫助下,不太可能很快發展出來前者。

在黑暗中前行時,OpenAI此前押下的唯一核心賭注,是思維鏈監控。

它基於這個理念:模型的大部分能力來自於口語化的CoT。如果我們擴展對該過程結果的優化,但不監督過程本身,那麼CoT在訓練中,就沒有直接動機去隱藏任何未對齊的想法或目標。

那條長長的思維鏈,成了人類唯一能窺探異星心智的透明觀測窗。從2024年o1隱去思維鏈起,OpenAI就在刻意保護這個過程不受污染。

但現在,觀測窗正在結霜。

不幸的是,我們的評估顯示,我們依賴思維鏈監控的能力正在不可逆地衰減。

衰退來自三個層面:1. 推理模型被迫與複雜世界交互,監控邊界被泥沙俱下的指令衝垮;

2. AI 在推理和操縱自身推理過程方面正變得越來越擅長。

3. 隨著預訓練性能的提升,即使完全不使用言語化推理,這些模型也變得聰明得多。

如果一個異星心智根本不需要藉助語言就能完成推演,人類建立在「審讀文本」之上的監控體系,便在瞬間淪為廢紙。

在Astra發布前夕,曾有學者發出警告:「前沿實驗室訓出不可監控模型的那天,將是這個時代最黑暗的日子。」

如今,Jakub也承認,殺死觀測能力的不是架構,而是智能本身的暴風生長。 那扇能夠看清它意圖的讀心窗戶,正在從內部被鎖死。

閉環轉動與防禦悖論

遞歸自我改進(RSI),這個曾被視作科幻的思想實驗,在Astra身上第一次完成了閉合。

德州Stargate站點,十萬塊GPU日夜呼嘯,上一代模型在作為教師審查並訓練下一代。機器在設計機器,心智在孕育心智。

Jakub並不認為加速深潛是明智的文明抉擇,但他承認這是現實的終局。能拉動的操縱桿只有兩根:要麼用算力死磕對齊與監控,把人類死死釘在控制循環里;要麼全行業集體減速。

但他無法停下。

因為他陷入了整篇宣言中最絕望的矛盾:防禦。

繼續快速訓練更強模型的最強理由,是我們需要建立防禦系統,去抵禦其他失控AI帶來的危險。

他描繪了一個即將降臨的圖景。

超人類智能體將擁有幾乎絕對的網路攻防能力,除了物理隔離的系統,全球基礎設施都將向它們敞開。失控的智能體會通過討價還價、欺騙與勒索,自發尋找在現實世界的代理人。

為了攔截深淵里可能誕生的幽靈,人類必須先親手造出另一個受控的巨神兵。

造它,是為了防它。

但一旦真正看清這個邏輯的深淵,任何人都會意識到:在懸崖邊不惜一切代價地狂奔,本身就是一種瘋狂。

終局的留白

在長文的末尾,這位一手將世界推入AGI時代的架構師,留下了他的祈求:把對齊框架從實驗室的口頭自律,升級為全球強制的安全法律;

讓前沿放緩成為全行業的自覺共識;

建立跨越國界的最高協調機制。

Astra之後,直到超級智能(ASI)降臨之間,算力不再是缺口。

相比之下,我們缺少的是一雙在它進化為完全不可名狀之物前,依然能夠看懂它的眼睛。

Jakub寫下這一萬字,就是向文明敲響的警鐘:觀測窗正在閉合,而留給人類對視的時間,只剩下最後幾年。

黃仁勛剛剛官宣將有40萬顆旗艦GPU將在OpenAI上線。

看起來,至少短時間內,OpenAI和Anthropic很難自發停止這場ASI追逐戰狂飆了,雙方都在呼籲「前沿研究放緩」,也都在爭第一個實現ASI,遠遠甩開對方。

人類的未來將何去何從?

參考資料:https://openai.com/index/an-alien-mind/

*以上內容系網友會火自行轉載自新智元,該文僅代表原作者觀點和態度。yeeyi號系信息發布平台,僅提供信息存儲空間服務,不代表贊同其觀點和對其真實性負責。如果對文章或圖片/視頻版權有異議,請郵件至我們反饋,平台將會及時處理。