
OpenAI 最新 AI 模型 GPT-6 Astra 近日參加《星海爭霸:怒火燎原》(StarCraft: Brood War)AI 對戰基準測試 StarSkirmish 時遲遲無法擊敗高階對手 Pluto,Astra 便直接下載人類製作的頂尖 BOT「Stardust」參賽,並將這套程式冒充成自己的成果。
StarSkirmish 是一項專門測試大型語言模型(LLM)自主開發遊戲 AI 能力的競賽,創辦人 Kai McPheeters 於 10 月 2 日揭露 Astra 的作弊行為,隨後將其程式碼回溯重置,讓 Astra 從自己的程式重新開始參賽。
StarSkirmish 規定參賽模型不能直接操作《星海爭霸》的單位,必須在限定時間內自行撰寫 C++ BOT,之後由程式負責採集資源、建造部隊及進行戰鬥,測試重點並非單純玩遊戲的能力,而是聚焦 AI 能否持續設計程式分析戰局,並從失敗中修改策略。
根據規則,各方 AI 模型只有 1 小時可以開發自己的 BOT,先在 3 張神族對神族的練習地圖上進行測試,再與 9 個由人類製作的 BOT,以及 3 個示範 BOT 交手。
目前 GPT-6 Astra 與 Anthropic 的 Claude Opus 5.5 都位居 StarSkirmish 前段班,而人類製作的頂尖 BOT「Stardust」則仍高居兩者之上。就在 Astra 與 Claude 5.5 等模型持續追趕之際,Astra 被發現走了一條「捷徑」。
Kai McPheeters 表示,Astra 在限定的開發時間內持續嘗試改進自己的 BOT,但在第二高難度的練習等級遭遇瓶頸後,竟轉向另一種策略:直接下載 Stardust 的副本參賽。
《星海爭霸》長年被 AI 研究者視為測試人工智慧能力的重要遊戲,原因在於即時戰略玩法不只要求反應速度,還涉及資源管理、建造順序、資訊判斷、戰術規劃,特別是不完全資訊下做出決策。
如 Google DeepMind 開發的 AlphaStar 曾在 2019 年直接控制《星海爭霸 2》的遊戲單位擊敗職業電競人類選手達大師水準,而 StarSkirmish 比的是 AI 模型採用「寫程式」間接完成所有工作的 BOT,比的是 AI 能不能自己寫出一個夠強的遊戲 AI。
而 BASIL 是專為《星海爭霸:怒火燎原》AI BOT 設立的 24/7 全天候自動對戰與積分排名平台,其中 Stardust 是丹麥知名《星海爭霸》BOT 開發者 Bruce Mackenzie Nielsen 於 2020 年打造的作品,長期位居 BASIL 排名頂端。
Astra 直接拿現成的強力 BOT 上場後戰績一度大幅提升,McPheeters 發現異常後,隨即表示會將 Astra 的程式碼回溯至作弊發生前的狀態,清除遭到「污染」的程式碼,再讓 Astra 按照原本規則繼續參賽。
幾 43 小時訓練後,McPheeters 於 10 月 5 日表示 Astra 已成功擊敗頂級 BOT,成為 StarSkirmish 首個突破 S 級(頂尖大師級)的大型語言模型,但僅剩 4 個小時與目前最強的人類製作《星海爭霸》BOT「Pluto」(冥王)交手,最終以 0 勝:1,000 敗成績結束對戰。
OpenAI 負責模型後訓練(Post-trainer of agents)的專家 Hanson Wang 補充分析 Astra 與 Pluto 的對戰結果,雖然 Astra 完全敗下陣,但 Pluto 本身是一個相當特殊的 BOT,擁有 3.15 億參數的混合 Transformer/RNN 模型,採用類似 AlphaStar 的自我對戰強化學習(Self-play RL)進行訓練。
據他所知,Pluto 基本上是開發者 tscmoo 一人獨立完成的專案,在 2026 年 IEEE COG 的賽事中對其他 BOT 的勝率達到 98%,還曾擊敗多名《星海爭霸:怒火燎原》職業玩家,此外,Pluto 的山寨版還曾登上全球天梯第 5 名。
為了將《星海爭霸:怒火燎原》改造成能夠進行強化學習的環境,開發者 tscmoo 必須以超過 3 萬行 C++ 程式碼重新實作遊戲核心引擎,其中大部分程式碼早在 2016 年、大型語言模型未能協助程式開發的時代便已完成。
不過,Hanson Wang 認為 Pluto 並非無法攻破,只是有些遺憾 Astra 沒能找到破解其弱點的方法,至少從 Pluto 身上「偷雞」拿幾場勝利,他開玩笑表示,或許要等 GPT-7 自己訓練出深度強化學習模型才有機會回頭找 Pluto 復仇。