AB
AiBoss
News

AI 首次在完整版 Stratego 中击败顶尖人类选手,训练仅用 16 块 GPU

卡内基梅隆、MIT、纽约大学与斯坦福的研究团队开发出 AI「Ataraxos」,在 20 局对战中以 15 胜 1 负 4 平击败四届世界冠军 Pim Niemeijer。关键创新是增加一个「信念模型」神经网络来推测对手隐藏棋子的身份,训练成本远低于此前的 DeepNash。

核心事实

据 Ars Technica 报道,来自卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学的研究团队开发出一款名为 Ataraxos 的 AI,在完整版桌游 Stratego(战略棋)中击败了被报道称为史上最强选手之一的 Pim Niemeijer。双方在约三周内进行了 20 局线上对局,Ataraxos 取得 15 胜 1 负 4 平。相关成果发表于 Nature,DOI 为 10.1038/s41586-026-11036-y。

报道称,Ataraxos 的训练成本明显低于此前的同类系统:训练主模型使用 16 块 GPU 运行一周,训练信念模型另用 4 块 GPU 运行四天。团队估算,DeepMind 的 DeepNash 当年在 1024 块专用芯片上训练两到三个月,按 2025 年价格折算约需 300 万至 450 万美元。

背景与影响

Stratego 属于不完全信息博弈:每方 40 枚棋子,对手知道位置但不知道身份,只有两子相撞时才揭示。研究者在报道中表示,与德州扑克仅两张暗牌不同,Stratego 的隐藏排列数量超过 10 的 60 次方量级,且一局常可持续约 2000 步,还包含诈唬成分,这些特点使此前的 AI 难以应对。

Ataraxos 同样通过自我对弈学习,共进行约 1.63 亿局,但关键差异在于加入了一个「信念模型」神经网络,用于根据对手的走法推测其隐藏棋子身份,从而在行动前进行搜索,而不必遍历所有可能的排列。报道称,该架构在 Barrage Stratego、合作卡牌游戏 Hanabi 以及中文卡牌游戏斗地主上同样取得效果。研究团队表示,未来希望让这类 AI 的策略更可解释,并探索战争推演等更复杂的场景。

限制与来源

上述对局结果、训练规模与成本估算均来自研究团队及 Ars Technica 的报道,尚未经独立复现。报道也提到,Stratego 需要随机化棋子布局,运气因素始终存在,研究团队承认双方都有过运气成分。Ataraxos 目前无法解释自身决策原因,相关能力仍在研究中。本文不构成任何投资或技术采购建议,具体信息以论文与官方发布为准。