热点资讯

大模型挑战星际争霸,结果全盘皆输

datetime

2026-09-25

阅读数量

2750

在一个名为 Brood War Bench 的测试平台上,一些主流的大模型被集结起来进行即时战略游戏的对抗赛。然而,令人失望的是,这些模型的表现都没能超过新手玩家。这一结果引人注目,因为《星际争霸:母巢之战》在人工智能研究中可谓耳熟能详。作为1998年推出的经典即时战略游戏,它一向是AI研究中的重要试验地。2019年,DeepMind的AlphaStar在该游戏中战胜过职业选手,那一时刻标志着人工智能在即时战略领域突破了人类顶尖选手的限制。但这场胜利的背景是AlphaStar经过专门的强化学习训练,而并非是为了聊天、编写代码或解答问题而设计的通用模型,它的所有能力集中在改善对《星际争霸》的表现上。

about image

Brood War Bench的测试则聚焦于当前的主流大模型,它们的功能包括对话、代码编写和处理多种任务。然而,当它们被置于实时对战的环境中时,其表现却未能突破新手的水平。这里形成了鲜明的对比:一方面是经过专门训练并能够击败职业级别选手的强化学习系统;另一方面是具备强大通用能力却在该游戏中无法胜过新手的大模型。相同游戏背景下,这两类系统的最终结果差距显著。

about image