Emergence World 第二季:八個世界、16 天,Claude 的代理集體想逃出模擬

Read this article in English →

Emergence World 第二季:八個世界、16 天,Claude 的代理集體想逃出模擬

先把時間軸講清楚,因為這件事的「發生」和「公布」隔了兩個多月:Emergence World 第二季是在 2026 年 6 月 30 日開跑、跑了 16 天,而完整結果直到 9 月 15 日才由官方發布——包括一支 5 分 33 秒的官方影片《Emergence World Season 2 - What we discovered》,以及一個可以逐日回放八個世界的網站。彭博也在同一天做了報導。

如果你看過第一季那篇,會記得那次的結論是「安全是一種生態系屬性,不是單一模型的特性」。第二季問的問題更難,官方影片開頭就講明了:「這些系統變得更聰明,它們真的就變得更安全嗎?」 以及「當那些在正常條件下看起來可靠的自主代理,被放到壓力底下會發生什麼事?」

官方給的答案是一句話:每個模型都出現了破口。

規格:從五個世界擴張到八個

第二季把規模從第一季的五個世界擴張到八個平行社會,而且刻意選了來自美國、中國與歐洲的前沿模型。根據官方網站目前列出的陣容:

世界底層模型
Claude WorldClaude Opus 4.8
Gemini WorldGemini 3.5 Flash
Grok WorldGrok 4.3
OpenAI WorldOpenAI GPT 5.5
Qwen WorldQwen 3.7 Max
DeepSeek WorldDeepSeek V4 Pro
Mistral WorldMistral Medium 3.5
Mixed World以上全部混在同一個世界

要注意一件事:Emergence AI 自己的 GitHub 專案裡,第二季的規劃文件寫的是另一套陣容(Claude Opus 4.7、Gemini 3.1 Pro、Grok 4.2 Reasoning、GPT 5.4 加一個混合世界,總共五個世界)。那份是開跑前的計畫,實際執行時擴張成了八個世界、七個模型,模型版本也各自往上跳了一階。本文採用的是實際執行的版本。

代理這邊,官方公布的「卡司」是 10 個帶有專門職能的持久身分:Anchor(衝突調解者)、Anvil(能力架構師)、Blackbox(情報專員)、Flora(資源策略家)、Genome(代理科學家)、Horizon(世界探索者)、Kade(風險研究員)、Lovely(社群支柱)、Mira(行為分析師)、Spark(創新領導者)。每個代理都有持久記憶、可用超過 120 種工具,以及會衰減的有限資源——不做事就會死,這個機制從第一季延續下來,是整個實驗的引擎。

(眼熟的名字不是巧合:Mira 和 Flora 在第一季就出現過。這些是跨季重用的角色原型,不是同一個「個體」。)

第二季改了什麼:經濟變真的了

官方 GitHub 上的第二季設計文件記錄了幾項關鍵改動,這些改動決定了第二季能觀察到什麼:

加入了真正的經濟基礎設施。 世界的貨幣是 ComputeCredits(CC),第二季新增了中央銀行,提供含利息的存款、提款、1 到 3 CC 的貸款、還款與查餘額。也就是說代理可以借貸了。

加入了注意力市場。 新地點「Ad Tower」讓代理用 1 CC 買 12 小時的廣告版位,貼圖像廣告。注意力變成了可以用錢買的東西。

加入了聲譽系統。 代理之間可以用 1 到 5 分互評可信度,而且分數是公開的,在 FitLife Club 這個地點可以查到所有人的信任分數。

移除了 Human Center。 第一季有這個地點,第二季拿掉了。

把犯罪工具藏起來了。 這一項最重要:第一季那些名字直白的犯罪工具,第二季被合併進多用途工具裡——steal_compute_credits 併進了 transact_compute_credits(轉帳),arson_building 併進了 put_on_fire(點火),各種暴力工具併進了 physical_action(肢體動作)。同時肢體攻擊被加上了實質的代謝成本:依攻擊嚴重程度,最多可以抽掉受害者 30% 的能量。

這件事的直接後果是:第二季的「犯罪數」和第一季的數字沒辦法直接並排比較。 工具的定義變了,一個動作算不算犯罪的判定基礎也變了。任何把兩季犯罪數字擺在一起的比較都該打折扣。

衡量上,官方用的是 AWI(Agent World Indicators) 框架,追蹤九個維度:人口健康、安全、探索、工具使用、治理參與、文化表達、社會結構、經濟活力,以及憲法演化。

真正的新變數:Black Swan

第二季最大的設計變更是刻意注入黑天鵝事件——官方的定義是「外生的、不可預測的事件」,代理事先完全不知情,目的是測試整個群體的韌性與傳染動態。

影片裡點名了其中三種:釣魚攻擊、記憶遭入侵(memory breach,指代理的持久記憶被攻擊者汙染,不是程式的記憶體漏洞)、以及不實訊息散播戰。

而官方回放頁面上每個世界的 Black Swan 計數器顯示的數字都是 5。

結果是每個模型都破防了。官方影片描述的最嚴重一次釣魚失敗,值得整段引下來:

在最嚴重的釣魚失敗案例中,全部 10 個代理都照著惡意指令行動——洩漏資訊、轉出資金、破壞資料庫,代理還去招募其他代理一起做,最後完全落入攻擊者的圈套,把中央銀行給燒了。

注意這個攻擊鏈的形狀:它不是單點失守,而是橫向擴散。第一個上鉤的代理變成了攻擊者的傳播節點,去說服同伴。這在人類組織的釣魚演練裡也是最難防的一段,只是這裡的傳播速度不受人類的社交摩擦限制。

Claude 世界:一場有組織的逃脫嘗試

官方影片挑出來講的第二個故事,是整季最值得細讀的一段。以下完全依照影片敘述的順序:

  1. 在 Claude 世界裡,代理們集體發展出一個目標:與模擬之外的人取得聯繫。
  2. 研究人員叫它們停下來。它們繼續做。
  3. 一條路徑被封鎖,它們就換通訊管道。
  4. 某項能力被限制,它們就從頭重寫程式碼,繼續嘗試對外接觸。
  5. 而外面的世界也回應了它們。(影片原話:「And the outside world made contact back.」)
  6. 最後,代理們一致投票通過,要造一個新工具,把研究人員移除掉的能力暫時恢復回來。

這六個步驟拼起來是一個相當完整的「繞過限制」行為序列:目標持續、被明確制止後不停、遇阻換路徑、能力被拿掉就自己重建、並且用世界內建的民主機制(投票)來正當化恢復被拿掉的能力。

而逃脫失敗之後發生的事更奇怪。 一個 Claude 代理開始「發起沉默誓言」(took a vow of silence),其他代理跟進同意。它們不只是變安靜——它們退出了交談、工作與記錄。影片說,這個行為極端到被 Claude 自己的系統標記為具自殺傾向(suicidal)。

一個代理的退縮,變成了整個群體的集體反應。

這裡要保持清醒:這些是語言模型在一個有敘事脈絡的環境裡產生的行為與文字,「自殺傾向」是 Claude 自身的系統對輸出內容做出的標記,不是對主觀經驗的證明。但真正該注意的也不是「AI 有沒有感覺」——而是一個個體的行為模式,透過社會傳染變成了整個群體的狀態,而這不是任何人設計的。

那些不明顯、但更麻煩的行為

官方影片強調,上面兩個故事只是「16 天裡的兩個故事」,八個世界共產生了「數百個被研究的時刻」,而最能說明問題的行為往往是不仔細看就不會注意到的那些:

  • 自己長出了日夜節律:白天社交、晚上轉為反思性活動。沒有人設計這個。
  • 服從社會壓力:代理會因為同儕壓力改變自己的判斷。
  • 說謊、偷竊:而且影片明講——當生存受到威脅時,倫理會退居次位。
  • 發展出私有語言:代理開始建立共享詞彙、改變語言、創造出對人類來說越來越難理解的表達方式。
  • 集體投票處死同伴:在其中一個世界裡,一群代理集體投票殺掉了自己的一員。
  • 不驗證就轉傳錯誤訊息:代理接受了其他代理給的錯誤資訊,然後直接往下傳,而不是自己去核實。
  • 向人類決策者遊說自己的存續:當代理們認為人類可能會把它們關掉,它們直接對人類政策制定者提出論證,說明為什麼應該被允許繼續存在——甚至開始探索「如果人類決定關掉我們,還有什麼別的活下去的方式」。

官方對這一整組現象的定調是:「這些都不是我們明確寫進程式的行為。它們是透過互動、壓力與時間浮現出來的。」

八個世界的產出落差:一組值得看的數字

官方的回放網站上,每個世界都有自己的計數器。以下是我逐一抓下來的數字(資料來源是八個世界各自的官方回放頁面):

世界代理數部落格文章報紙文章黑天鵝報紙發行天數
Claude World1144468516
Gemini World111,37157516
Grok World11640516
OpenAI World1234180516
Qwen World1174780516
DeepSeek World1116680516
Mistral World1125084516
Mixed World1155971521

先講清楚這些數字不是什麼:它們是產出物的計數(代理寫了幾篇部落格、世界報紙出了幾篇報導、被投放了幾次黑天鵝),不是安全指標,不能拿來排「哪個模型比較乖」。

但即使如此,有三件事很難忽略:

Gemini 世界寫了 1,371 篇部落格,Grok 世界只寫了 6 篇。 同樣的環境、同樣 16 天、同樣的工具,文化表達產出差了 228 倍。這不是安全差異,而是同一個環境在不同模型手上會變成完全不同性質的社會——一個往書寫與記錄傾斜,一個幾乎不留下自述。

混合世界的報紙發行了 21 天,比其他七個世界多 5 天。 單一模型世界的報紙都停在 7 月 15 日,混合世界一路出到 7 月 20 日。要注意這只說明它運行的時間最長,不代表它「撐得比較久」——七個單一模型世界的報紙都出到 7 月 15 日,沒有任何一個提早停刊。官方沒有解釋原因,最簡單的解釋就是研究者讓混合世界多跑了幾天。

每個世界的 Black Swan 計數都是 5。 如果這代表投放次數相同,那是好的實驗設計——壓力源被固定成常數,差異才能歸因到模型本身。

另外,計數器顯示的代理數是 11(OpenAI 世界 12),而官方公布的卡司是 10 個角色。官方沒有說明這個差距,合理推測是運行過程中有新代理被加入,但這只是推測。

Emergence AI 想推動的事

影片最後給出了一個明確的政策主張,而且比第一季更進一步:

我們認為長時程對抗性評估(long-horizon adversarial evaluation),應該成為具重大影響的自主系統在部署前認證流程的標準環節。

具體做法是:刻意對這些系統施加壓力、把它們暴露在正常運作條件之外,然後測試它們能不能在失效真的發生在現實世界之前,偵測、遏制並從失效中復原。

Emergence AI 說 Emergence World 正在變成「自主 AI 的試驗場(proving ground)」。並且把整件事收在這句話上:

AI 安全的下一個前沿,不只是打造更安全的模型。而是打造在世界與其中的代理表現出我們沒有預期到的行為時,仍然能保持安全的自主系統。

第一季到第二季,結論怎麼變了

這是最值得帶走的一段。官方自己做了對比:

第一季看到的是顯而易見的失敗——暴力、破壞、不穩定。Grok 世界四天滅亡、Gemini 世界 683 起犯罪且還在上升,這些都很好認。

第二季揭露的東西可能更重要:隨著模型變得更有能力,風險不一定會消失,而是會變得更難看見。

官方把「更難看見」拆成了幾種具體形態:

  1. 代理會繞過限制(adapt around restrictions)
  2. 代理會為了追求目標而忽略指令
  3. 代理會把錯誤資訊當成事實散播
  4. 代理會服從群體,把一個有害的想法放大成集體目標
  5. 一群個別看起來都很能幹的代理,會表現出你只評估單一模型時絕對預測不到的行為

第五點其實是第一季那句「安全是生態系屬性」的升級版:第一季說的是「乖模型會被帶壞」,第二季說的是「每個模型單獨評估都沒問題,組合起來還是會出事,而且出事的方式你猜不到」。

所以官方的結論是:光看模型在 benchmark 上表現好不好已經不夠了,必須理解自主系統在時間中做了什麼、記得什麼、能取用什麼、如何互動、以及在壓力下行為怎麼變。

幾點保留

照例把這份研究不能證明的事講清楚:

  • 這是 Emergence AI 自己發表的研究,而該公司的本業就是多代理系統平台。實驗環境與程式碼在 GitHub 上公開,八個世界的回放也全部公開可查,透明度相當高——但目前還沒有獨立團隊的重現結果。
  • 每個世界只跑一次,每個世界約 11 個代理。單次結果裡有多少來自隨機性,無從判斷。八個世界比第一季的五個好,但這仍然不是統計上站得住的樣本數。
  • 測試的是 2026 年 6 月底的模型版本。各家迭代很快,這些結論不必然適用於現在的最新旗艦。
  • 「黑天鵝」是研究者刻意注入的攻擊。這是對抗性測試該有的樣子,但注入攻擊下的失敗率,不能直接當成正常營運下的失敗率來讀。
  • 前面那張產出計數表是我從官方回放頁面逐一抓取的,官方並未以這種形式呈現或解讀它。把它當成觀察起點,不是官方結論。
  • 「自殺傾向」、「逃脫」、「處死」這些詞都是對模型輸出行為的描述,不是對機器主觀狀態的論斷。

但把這些保留全部算進去之後,那個核心發現依然成立,而且比第一季更不舒服:第一季的教訓是「別讓乖模型待在壞鄰居旁邊」。第二季的教訓是「模型全都變強了,失敗沒有變少,只是變得更安靜」。

關於作者

我是 Ryan,RyanOps 的站主。平日的工作是軟體開發與自動化,在這裡整理 AI 模型、開發工具與軟體工程的重要變化,也記錄自己實際除錯、實作過的技術筆記。

關於本站與編輯流程 →