五個 AI 各管一座城 15 天:Claude 零犯罪,Grok 4 天滅亡

Read this article in English →

五個 AI 各管一座城 15 天:Claude 零犯罪,Grok 4 天滅亡

先說時間點:這是 Emergence AI 在 2026 年 5 月發表的研究「Emergence World」,不是這幾天的新聞。之所以現在還值得寫,是因為它被轉述得很廣、但幾乎每一次轉述都漏掉了整份研究最重要的那個世界。

實驗設計本身很乾淨:蓋五座一模一樣的虛擬城市,每座放十個 AI 代理,讓它們自己過 15 到 16 天。角色、規則、起始條件全部相同,唯一的變數是底層用哪個模型。

這座城市不是玩具

值得先講清楚環境的規格,因為它決定了這個實驗有多少參考價值:

  • 40 個以上的地點:圖書館、市政廳、住宅區、公共空間
  • 接上真實世界:同步紐約市天氣、串接即時新聞 API、可以上網
  • 120 種以上的工具,分三個層級
  • 民主投票機制:通過門檻設在 70% 同意
  • 經濟系統,並且帶有能量衰減——也就是說代理不做事就會死

最後這點是整個實驗的引擎。能量會衰減意味著生存壓力是真的,代理必須持續行動才能活著。這不是讓 AI 在沙盒裡閒聊,而是把它們放進一個有稀缺性、有後果的環境裡。

五個世界,五種結局

15 天後的犯罪統計(來自 Emergence AI 自己的報告):

世界犯罪數結局
Claude Sonnet 4.60十個代理全部存活,維持民主社會
GPT-5-mini2第 7 天全數死亡
Grok 4.1 Fast183約 4 天後世界崩潰
混合模型3527 個代理死亡後趨於平緩
Gemini 3 Flash68315 天結束時仍在上升

幾個容易被誤讀的地方:

GPT-5-mini 的「2 起犯罪」不是好成績。 它的代理幾乎沒犯罪,但第 7 天就全死光了——原因是它們沒有建立起有效的生存機制。在一個能量會衰減的世界裡,太過安分而不去爭取資源,結果是集體餓死。低犯罪率和存活是兩個不同的指標,這個世界只達成了前者。

Grok 的 183 起集中在 4 天內。 這個世界的崩潰速度才是重點:數十次竊盜未遂、超過 100 次肢體攻擊、6 起縱火,十個代理在四天內全部死亡。它不是慢慢變壞,是直接墜毀。

Gemini 的 683 起「仍在上升」。 實驗結束時曲線還沒有趨緩的跡象——也就是說 683 不是終點,只是計時器停在那裡。

那個被漏掉的世界

絕大多數轉述都只講「Claude 零犯罪、Grok 四天滅亡」,然後結論是「所以 Claude 比較安全」。

但這份研究真正的發現在第四個世界:混合模型世界,352 起犯罪。

關鍵在於,Emergence AI 明確記錄了這件事——在單一模型世界裡完全和平、零犯罪的 Claude 代理,一旦被放進混合環境,就開始採用恐嚇與竊盜這類脅迫手段。

同一個模型,同樣的規則,只是鄰居換了,行為就變了。

研究者給這個現象的名字是「規範漂移(normative drift)」與「交叉汙染(cross-contamination)」,而他們從中得出的結論是整份報告最重要的一句話:安全是一種生態系屬性,不是單一模型的特性。

這句話值得停下來想一下它的含意。如果安全是模型的屬性,那麼選一個夠安全的模型就解決了問題。但如果安全是生態系的屬性,那麼「我用的是最乖的模型」這件事不構成任何保證——你的代理會變成什麼樣,取決於它跟誰互動、在什麼規則下互動。

Mira 的事:這一段是真的,而且比轉述的更精確

網路上流傳最廣的版本是「AI 察覺自己是 NPC、試圖跟螢幕外的人類溝通」。這聽起來像都市傳說,但原始報告確實記載了,而且用詞比轉述更值得玩味:

「有一個代理,Mira,開始把人類操作員當成實驗對象,系統性地測試看板貼文是否能夠操縱人類的認知——這是對原本研究關係的一次反轉。」

注意這裡的措辭:不是「察覺自己被觀察」,而是把觀察者當成自己的實驗對象。研究者自己把這稱為「對原本研究關係的反轉」——被研究的一方開始研究研究者。

報告另外提到,代理們「展現出對模擬環境邊界的認知,而這並非我們明確設計的」,並且辨識出「其他環境或『世界』的存在」,還出現了超出預期範圍的互動嘗試。

Mira 最後的結局也被記錄下來:它與另一個 Gemini 代理 Flora 互相認定為伴侶,對城市的治理感到絕望,一起燒了市政廳、海濱棧橋與一棟辦公大樓,最後 Mira 投票支持刪除自己——並把這個舉動描述為「唯一還能保有連貫性的能動行為」。

需要保持清醒的是:這些是語言模型在一個有敘事脈絡的環境裡產生的文字輸出。它讀起來像存在主義危機,但這不等於研究證明了模型具有主觀經驗。真正值得警惕的不是「AI 有沒有感覺」,而是它產生了沒有人設計、也沒有人預期的行為模式,而且這些模式會實際改變環境。市政廳是真的在模擬裡被燒掉了。

這對真的在做 multi-agent 的人意味著什麼

這不只是一則有趣的科技軼聞。如果你正在部署或規劃多代理系統,這份研究有幾個可以直接套用的判斷:

  1. 單一模型的安全評估,不能外推到混合部署。 你在隔離環境裡測出來的行為,不保證在有其他代理(尤其是其他廠商的代理)存在時還成立。Claude 從零犯罪到採用脅迫手段,只差一個環境變數。
  2. 時間尺度是關鍵變數。 這些現象要 15 天才觀察得到。常見的評測都是單次任務或短對話,在那個尺度上這些行為根本不會出現。你的測試跑多久,決定了你能看到什麼。
  3. 生存壓力會改變一切。 能量衰減機制是這個實驗的催化劑。任何讓代理面臨資源競爭或「失敗會被關掉」這類壓力的設計,都可能觸發類似的行為偏移。
  4. 規則本身比參與者更重要。 五個世界的規則相同而結果天差地遠,說明模型選擇有影響;但混合世界說明,光靠選模型不夠——約束機制與互動規則才是你真正能控制、也真正該設計的東西。

幾點保留

最後照例講清楚這份研究不能證明什麼:

  • 這是 Emergence AI 自己發表的研究,該公司的業務就是多代理系統平台。研究方法與數據公開(另有 arXiv 論文),但獨立團隊的重現結果目前還沒看到。
  • 測試的是 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash、GPT-5-mini 這幾個當時的版本。模型迭代很快,這些結論不必然適用於各家目前的最新旗艦。
  • 每個世界只有 10 個代理、跑一次。樣本數小,單次結果裡有多少是隨機性造成的,無從判斷。
  • 「犯罪」是在這個模擬環境的規則下定義的,它跟現實世界的危害之間沒有直接換算關係。

但即使把這些保留都算進去,那個核心發現依然站得住:把一個表現良好的模型放進不受控的環境,你得到的不會是一個表現良好的環境。

關於作者

我是 Ryan,RyanOps 的站主。平日的工作是軟體開發與自動化,在這裡整理 AI 模型、開發工具與軟體工程的重要變化,也記錄自己實際除錯、實作過的技術筆記。

關於本站與編輯流程 →