Ataraxos击败Stratego最强人类棋手
The Decoder··作者 Maximilian Schreiner
关键信息
Stratego之所以困难,是因为双方都要秘密布置40枚棋子,可能的初始布局超过10^33种,而且高水平策略需要有意识地保持行动随机性。Ataraxos完全通过自我对弈学习,利用正则化方法鼓励多样化的布局和走法,并随着训练推进逐渐降低这种压力;由于它没有与DeepMind的DeepNash进行直接对局,因此两者的成本和表现不能进行完全等价的比较。
资讯摘要
来自卡内基梅隆大学、纽约大学、斯坦福大学和麻省理工学院的研究团队推出了用于Stratego的人工智能系统Ataraxos。研究人员在《Nature》发表的论文中称,据他们所知,这是首个在该游戏中达到超人水平的人工智能。Ataraxos在正式的20局系列赛中击败荷兰棋手Pim Niemeijer,取得15胜、1负和4和的成绩。Niemeijer曾四次赢得世界冠军、15次赢得荷兰全国冠军和两次赢得线上世界冠军,并连续超过600周位居世界排名榜首。
Stratego对人工智能而言非常困难,因为双方都要将40枚棋子背面朝上布置,可能的布局超过10^33种,棋手还必须根据此前和当前对局中的隐藏信息作出决策。研究人员表示,DeepMind此前的DeepNash未能超过最强人类棋手,而Ataraxos只使用16块Nvidia H100 GPU训练一周,随后用4块GPU训练其信念网络四天,估计成本低于8000美元。他们将这一效率归因于自研GPU模拟器、更高的样本效率,以及一种先迫使系统大幅变化、再逐渐采用小幅稳定更新的训练流程。由于研究人员称DeepMind的旧代码已经无法运行,Ataraxos与DeepNash之间并没有直接对局。

资讯正文
卡内基梅隆大学、纽约大学、斯坦福大学和麻省理工学院组成的团队,开发出了一款能够 decisively 击败有史以来最成功的 Stratego 棋手的 AI。据报道,训练成本不到 8,000 美元。
在发表于《Nature》的一篇论文中,来自卡内基梅隆大学、纽约大学、斯坦福大学和麻省理工学院的研究人员介绍了 Stratego AI——Ataraxos。据作者所知,这是首个在这款棋类游戏中达到超人类水平的 AI。在一场官方进行的 20 局比赛中,Ataraxos 以 15 胜、1 负、4 和的成绩击败了荷兰棋手 Pim Niemeijer。
Niemeijer 被认为是这项运动历史上荣誉最多的棋手。他曾四次赢得世界冠军、15 次赢得荷兰全国冠军,并两次赢得线上世界冠军;他还曾连续超过 600 周位居世界排名第一。自 1997 年以来参加过每一届世界锦标赛的唯一一位棋手 George Franka 称 Niemeijer 是“有史以来最优秀的 Stratego 棋手”。
Stratego 对 AI 来说尤其困难,因为双方都要将自己的 40 枚棋子背面朝上摆放。据论文介绍,可能的初始布局超过 10^33 种。第一作者 Samuel Sokota 在 X 上写道,在这类信息不完全的游戏中,一步棋的价值不仅取决于之后的对局如何发展,也取决于决策之前和决策过程中发生了什么。
Sokota 表示,源自扑克 AI 的方法确实绕过了这一问题,但仅限于隐藏信息很少的情况。在德州扑克中,可能的起手牌只有 1,326 种;而论文指出,随着隐藏信息量增加,这些方法所需的计算量也会增加。因此,Stratego 成为了最后几项人类仍然优于 AI 的主要竞技棋类游戏之一。
大学预算击败了 DeepMind 数百万美元投入未能突破的难题
DeepMind 此前未能在这款游戏中突破顶尖人类棋手的水平。据论文介绍,DeepNash 的一位共同作者回忆称,该系统曾在 1,024 个 TPU 节点上训练两到三个月。Ataraxos 的作者估计,按 2025 年的价格计算,这样的训练成本将达到 300 万至 450 万美元。
相比之下,Ataraxos 只需要在 16 块 Nvidia H100 GPU 上运行一周,另外再用 4 块 GPU 运行四天来训练其所谓的信念网络。按 2025 年的价格计算,总成本不到 8,000 美元。研究人员估算,其计算成本约为前者的 1/500,自我对弈局数为 1/30,训练样本数为 1/100。他们将这一成果归功于自己编写的定制 GPU 模拟器,同时也归功于大幅提高的样本效率。Sokota 写道,由于团队只能使用学术计算资源,他们多年来积累了大量技巧。
两套系统之间没有进行过直接对比。研究人员表示,他们曾提出构建所需的基础设施,但 DeepMind 告诉他们这不可行,因为 DeepNash 的代码已经无法运行。在 2023 年世界锦标赛上,DeepNash 赢下了 28 局中的 19 局,但输给了大多数顶尖棋手,其中包括 Niemeijer。
迫使 AI 不断变化策略,可以避免它陷入僵局
Ataraxos 不使用任何人类数据进行学习,完全通过与自己对弈来训练。论文称,关键在于系统被推动改变其下法的程度。训练期间增加的一项条件,会让 AI 分散其布阵和走法,而不是过早固定在某种策略上。这被称为正则化。作者表示,这一点在 Stratego 中十分重要,因为高水平的下法需要大量随机性,而可预测的棋手很容易被对手利用。
随着训练推进,研究人员逐步减弱这种约束,并相应调整学习步长。训练初期,Ataraxos 会大幅改变自己的下法,并进行大幅度跃进式学习;到了后期,它的下法更加审慎,只做小幅修正。这样可以避免学习过程陷入循环或变得混乱,而在信息不完全的游戏中,这些情况往往容易发生。研究人员将正则化比作一笔能量储备。如果 AI 消耗得太快,它虽然能在早期迅速取得进展,却会失去持续学习的能力,而且往往会变得很容易被对手利用。
Ataraxos 还使用了一个信念网络,用来预测对手隐藏棋子的位置。在每一步走棋之前,AI 都会利用该网络生成可能的棋局状态,推演候选走法,并专门针对这次决策再进行一次额外的学习。作者称,早期研究之所以跳过这类搜索,是因为在存在如此多隐藏信息的情况下,这被认为过于困难。
AI 在先天处于劣势的情况下仍取得压倒性胜利
为了避免疲劳,并给 Niemeijer 留出准备时间,研究人员将他与 Ataraxos 的系列赛分散在三周内进行。Niemeijer 知道 Ataraxos 不会针对他的风格进行适应。他因参赛获得了 1,000 美元的报酬,此外每赢一局可得 100 美元,每和一局可得 50 美元,因此他有经济上的动机全力发挥。
作者写道,按和棋计半胜计算,有效胜率达到 85%,这在最高水平的比赛中前所未有。三届世界锦标赛亚军 Max Roelofs 表示,顶尖选手之间的差距极其微小,因为这项游戏迫使棋手承担风险。AI 还面临结构性劣势。Niemeijer 可以在多局比赛中逐渐适应它,但它无法适应 Niemeijer。论文称,三届世界冠军 Vincent de Boer 认为这是一个重大劣势。
在 2025 年 Stratego 世界锦标赛期间的一场表演赛中,Ataraxos 还战胜了锦标赛选手,在 40 局比赛中赢下 38 局。棋手们形容它的风格难以捉摸。这个 AI 会进行人类认为风险过高的虚张声势;而当它处于落后时,又会顽固地拖延,有些棋手甚至觉得这种做法很无礼。它看起来还幸运得近乎诡异,因为它的棋子似乎总是恰好处在最合适的位置。Ataraxos 与 Niemeijer 的对局已在网上公开。
这种方法的适用范围远不止 Stratego
研究人员还采用相同的方法构建了其他系统。在 Barrage Stratego 变体中,他们的 AI 在与排名前四的四名顶尖选手中的三人进行的四组、每组 50 局的系列赛中获胜;这三人都曾两度获得 Barrage 世界冠军。在合作卡牌游戏 Hanabi 中,它在每个变体中都创下了新纪录;在双人版本中,其所需的计算量比此前的领先系统少了两个数量级。在中国卡牌游戏《斗地主》中,它击败了此前的基准系统 PerfectDou 和 DouZero。
作者根据这些结果得出了一个颇为宽泛的结论。他们认为,大量隐藏信息已不再是强化学习和搜索面临的障碍。只要能够为相关问题构建快速且准确的模拟器,实用型 AI 就有望应用于许多战略决策问题。论文将金融市场、军事冲突和谈判列为信息不完备情境的例子。
研究人员承认,这一方法存在一个局限。由于搜索过程只能模拟单个学习步骤,因此不能仅靠增加计算时间来持续提升性能。更复杂的搜索方法或许可以改变这一点。该团队已公开 Ataraxos 的代码。
来源与参考
收录于 2026-10-02