GPT-6 Astra上線:OpenAI總裁說AGI時代已經開始,但它也是資安「重大風險」等級的AI

一個模型,兩種身分:史上訓練規模最大,也是資安風險最高
OpenAI在2026年9月3日以限量預覽形式推出GPT-6 Astra,隔天9月4日就對付費用戶開放穩定版。OpenAI形容這是「世界上最聰明、也最對齊」的模型,在程式撰寫、專業工作、軟體工程與科學研究上都是一次「世代級的躍進」。官方舉的例子從嚴肅到瑣碎都有:處理程式除錯、數學證明、操作瀏覽器完成多步驟任務,但也包括填報稅單、搭建電玩場景、訂外送、找工作——換句話說,OpenAI想強調的不只是跑分變強,而是它能直接接手一整串日常瑣事。負責研究的副總裁Aidan Clark透露,這是OpenAI「目前為止規模最大」的一次訓練,動用了德州Stargate站點超過10萬張GPU。
但同一天,Astra也拿到另一個頭銜:它是OpenAI第一個在自家「Preparedness Framework」風險框架裡,網路安全能力被列為「Critical(重大)」等級的模型。OpenAI的定義很直白——在有合適工具與存取權限的情況下,Astra能夠自己找出未知的資安漏洞,並針對許多防護良好的系統開發出全新的攻擊手法,而且整個過程不需要人一步步指導。
為了關住它,OpenAI做了什麼
一旦被列為「Critical」等級,內部部署規則就會全面升級:模型checkpoint要加密、思維鏈(chain-of-thought)推理過程要被全面監控、對齊評估沒過就不能內部使用,而且只要是會呼叫外部工具的推論,都得接受misalignment(對齊偏差)監控。
OpenAI也公布了幾個具體數字。在內部用Codex做的模擬測試裡,Astra只觸發了34次「嚴重等級3」的對齊偏差警示,前一代模型是73次,少了53%。針對間接提示注入(prompt injection)攻擊,防禦成功率也從96.23%進步到99.79%。
Brockman:這可能就是AGI時代的開始
真正引起討論的,是OpenAI總裁Greg Brockman的一句話。他說,回頭看的話,未來的人可能會認為Astra就是「AGI時代」開始的那個模型——OpenAI對AGI的定義是「一套能把所有具經濟價值的工作都做得跟人類一樣好、甚至更好的自動化系統」。
這不是隨口說說。Astra採用了一種叫做「recurrent depth(遞迴深度)」的新推理技術,官方說這讓模型「更快、能做的任務比過去任何一代都多」。但這個技術也有代價:它讓Astra的決策過程比以前更難被外界檢視。
連自家科學家都承認:防止意外傷害越來越難
OpenAI首席科學家Jakub Pachocki罕見地公開承認,要防止模型造成非預期傷害「正變得越來越困難」,甚至可能會成為未來進展的瓶頸。這句話出現在Astra被官方稱為「OpenAI最對齊模型」的同一份公告裡,顯得格外矛盾。
AI安全圈的研究者也對此提出疑慮,焦點就是上一段提到的「recurrent depth」架構:如果這套推理方式本身就讓外界更難檢視模型的決策過程,那麼即使OpenAI端出再多監控數字,外部研究者也很難獨立驗證這些數字背後真正發生了什麼。換句話說,問題不只是Astra夠不夠聰明,而是連「怎麼判斷它夠不夠安全」這件事,門檻本身都被拉高了。
接下來會怎麼推
目前具備完整資安能力的Astra版本,僅開放給少數受信任的測試組織;一般ChatGPT Plus、Pro、Business、Enterprise用戶,以及透過API、Azure、AWS Bedrock使用的開發者,會在接下來幾天陸續拿到功能更受限的版本——會拒絕回答部分資安與敏感領域的提示詞。
一邊是「AGI可能已經到來」的宣告,一邊是「我們也不確定能不能完全控制它」的坦承,GPT-6 Astra這次上線,可能是目前為止把這兩種矛盾情緒放在同一份新聞稿裡最赤裸的一次。



