大模型能玩即时战略游戏吗?我们让 AI 智能体指挥了一整场 RTS 对局
大模型能玩即时战略游戏吗?讲清 RTS 为什么难倒语言模型,复盘 AI 智能体打赢的两场完整对局,并附上让你的智能体上场的命令。
回合制游戏对语言模型很友好。国际象棋会等你,宝可梦会等你,文字冒险游戏能等到天荒地老。即时战略游戏谁也不等:它每秒跑三十个逻辑帧,模型还在读战场,它的坦克已经在挨打了。
那么,大模型到底能不能玩 RTS?能。2026 年 9 月 27 日,我们在自己的公开服务器上看着一个 LLM 智能体对阵另一个 LLM 智能体,连赢了两场完整对局。这篇文章写给正在用编程智能体(Claude Code、Codex、Cursor 之类)的人,想看看它面对一场战争会怎么做;也写给所有在关心“AI 智能体能不能玩游戏”这个问题的人。下面依次讲:为什么实时对模型来说很难,业界绕开它的三种思路,我们的对局里实际发生了什么,以及怎样让你自己的智能体上场。
为什么即时战略游戏对大模型很难
有三件事和模型作对。
速度。 模型回答一次要几秒,一场遭遇战一秒就定了。如果每道命令都要等模型往返一趟,模型永远在应对一场已经打完的仗。
战争迷雾。 RTS 把大半张地图藏起来。模型得决定去哪侦察、记住看到过什么、猜测看不到的东西。正在炮击它基地的火炮,可能根本不在视野里。
长线决策。 一局二十分钟,经济、科技、军队的每个决定都要很久以后才见分晓(或者见败局)。第二分钟升不升级采矿场,决定了第十二分钟养不养得起一支舰队。
让 AI 玩策略游戏的三种思路
端到端地学。 DeepMind 的 AlphaStar 在 2019 年达到《星际争霸 II》宗师段位,靠的是在游戏本身上训练,并通过和人类相同的操作界面来玩。这条路走得通,但需要一个研究实验室和一笔训练预算,练出来的东西也只会玩这一款游戏,不是你手头已有的模型。
把游戏变成文字。 NeurIPS 2024 论文 Large Language Models Play StarCraft II 提出的 TextStarCraft II 环境,用文字向模型描述战局、再把宏观决策收回来,并用“摘要链”(Chain of Summarization)把许多帧压缩进一次提示。它的智能体打赢了难度为 Harder(5 级)的内置 AI,之后又出现了 SC2Arena 等基准。这个形状适合大模型,但场上仍然只有模型一个玩家,比它思考更快的事情就没人做。
让模型当指挥官,而不是操作员。 这是我们在《钢铁浪潮》里采用的做法。模型不去微操每一个单位,而是站在一个快速的执行者之上下达命令,就像将军指挥一个师。正是这层分工,让我们拿下了那两场胜利。
LLM 智能体如何玩《钢铁浪潮》
《钢铁浪潮》是一款跨平台现代战争即时战略游戏:建基地、搞经济,陆海空单位同图作战。它有一个命令行工具 steel,加入专用服务器的方式和浏览器版游戏完全一样。智能体通过三层来操控一个席位:
- 大脑。 游戏自带的 AI 每秒都在替这个席位做事:建造顺序、经济、生产、防守、进攻波次。它和人一样,受这个席位的战争迷雾限制。
- 智能体。 大模型读一屏汇总(
steel brief),然后给大脑“掌舵”(steel auto --favour mbt=3、--posture hold、--target x,y),或者把任何单位、建筑、决定收归自己手里。 - 脚本。 凡是必须比智能体一轮思考更快的事,智能体就写成一个简短的 TypeScript 文件。会话每隔零点几秒运行一次,看到的只是这个席位能看到的东西。
第三层就是速度问题的答案。模型本身不需要快,它只需要写出一个够快的东西。
实战记录:公开服务器上的两场对局
两场都是一对一,在官方服务器上进行,对手是另一个用同一套命令行的 LLM 智能体。我们这边是 Claude,在 Claude Code 里运行,装了《钢铁浪潮》的技能包。下文所有内容都来自对局日志。
第一场:燃速公路(陆战)
开局照常由大脑打。第三分钟,智能体派三辆轻型坦克去袭击地图中央的敌方采矿场并摧毁了它,但有两辆追得太深,折了。旁观的人类给了一句提示:尽早把采矿场升到 3 级,因为深层采矿场每分钟产 480 金属,2 级只有 180。
智能体把这句提示变成了一个脚本:每秒挑离家最近的采矿场,预留出足够的金属不让大脑花掉,钱一够就下令升级。收入从每分钟 336 涨到第十一分钟的 2,400,第十四分钟超过 4,400。
它还抓住了大脑最大的失误。大脑在把坦克三三两两地送进敌方基地,每一小队都孤零零地死掉。智能体把大脑的姿态改成“固守”,一直等到十九辆野牛主战坦克集结完毕,再全军压上。这支部队赢下了中路决战,一路开进敌方基地。敌方总部在 17:33 倒下,17:52 对局结束,我们获胜。
第二场:霍尔木兹海峡(海战)
霍尔木兹海峡这张图把双方基地隔在海的两岸,光有坦克毫无用处。这一次智能体把采矿场脚本放进了开局:4:14 时收入每分钟 1,308,大约是第一场同一时刻的三倍。
大脑迟迟不建造船厂和战争实验室,智能体就亲手把两者都建了。工程船占下了海中小岛,眼镜蛇武装直升机把岛上的敌人清掉,侦察则找到了敌方基地:外面围着一圈防空炮塔。直升机过不去。
这时智能体的推理派上了用场。它读了单位数据:君王战列舰能从十四格外炮击陆地,而防空炮塔根本打不到船。它把生产转向战列舰,配虎鲸驱逐舰护航;卖掉一座占着生产名额的陆军工厂(一个总部只供得起三座生产建筑),又建了第二个总部来多拿名额。然后它写了一个舰队脚本:每艘战列舰炮击射程内最近的敌方建筑,射程内没有,就开到离目标最近、够得着的那片水域。
敌方造船厂最先被摧毁,接着是防空导弹阵地、机场、战争实验室和那道防空墙。一次空中扫荡找到了敌方总部,它在 22:02 倒下,对局于 22:20 结束。
大模型做得好的,和做得不好的
做得好: 它会读数据、自己找出克制(用战列舰打防空墙),没人教。它看见了大脑看不见的东西:添油式的进攻、海图上白占名额的陆军工厂。它还能在一场正在进行的对局里写出能用的脚本,服务器拒绝某道命令并说明原因后,再把脚本改好。
做得不好: 它的第一个脚本为了升级把金属攥得太紧,第五到第九分钟军队几乎为零;对手要是那时进攻,它就是光着的。在霍尔木兹海峡,它有好几分钟攒着 3,000 到 4,500 金属花不出去,才想到第二个总部。而且当天最好的主意(尽早升深层采矿场)来自旁观的人类,不是模型。
对阵另一个智能体的两场胜利只是两个数据点,不是基准测试。席位大脑单独作战的如实战绩写在智能体页面上:对受迷雾限制的“老练” AI 打成平手,对唯一能透视迷雾的内置 AI“老兵”则很少赢。真正要拉开差距的,是智能体的判断。
让你自己的智能体试试
安装命令行(一个自包含的二进制文件,不需要 root):
curl -fsSL https://steelti.de/cli.sh | sh
安装技能包,它会教你的智能体命令和战术:
npx skills add steel-tide/skills --skill steel-tide-cli
然后用你自己的话让智能体上场:
加入 play.example.com 上的《钢铁浪潮》服务器,加入码是 <加入码>,以 Claude 的名字参战,打赢这一局。
你可以用安装器自建服务器,让两个智能体各占一个席位、自己在浏览器里观战,也可以用 steel lab 在无界面模式下拿脚本和内置 AI 对打。更多内容见智能体页面。
常见问题
ChatGPT、Claude 或 Gemini 能玩即时战略游戏吗?
任何能执行命令行的模型都能通过 steel 玩《钢铁浪潮》。技能包是为编程智能体写的;模型不需要视觉能力,因为战场是以文字返回的。
AI 会作弊吗? 不会。智能体只能看到自己席位看得到的东西,每道命令都发往服务器,像一次点击一样被裁定。脚本的视野和限制也一样。
这算基准测试吗? 还不算。它是一种玩法。同一台服务器上的两个智能体、同一张地图、同一套规则,已经具备了基准测试所需的大部分条件,我们很希望看到有人来跑一次。
