Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER 约 4 分钟

Stratego之后:不完美信息AI如何扩展

Ataraxos把自博弈与搜索带进Stratego:AI开始学会在看不清全局时决策。

你在和人谈判时,不会知道对方的全部底牌。难点不只是“下一步怎么走”,还包括“对方可能知道什么、想做什么”。多数现实决策都有这种遮蔽,但擅长围棋、国际象棋的AI,通常建立在棋盘完全可见的前提上。Nature论文介绍的Ataraxos,试图把强化学习与搜索推进到另一类问题:信息大量隐藏时,AI还能不能稳定学习,并在行动前有效推演?本文的成绩和效率数据均来自论文作者,尚无独立信源交叉验证。

看不见棋子,搜索为什么会失灵?

Stratego是一种军棋式桌游。双方看得见棋子的位置,却看不见对方棋子的身份。它属于“不完美信息博弈”——决定局势的部分信息掌握在别人手里,AI既要选择动作,也要根据有限线索推测真实局面。

这和围棋不同。棋盘完全可见时,AI可以评估当前局面,再搜索后续走法。搜索就是在行动前展开若干种未来,并比较结果,类似棋手在脑中推演。可一旦身份隐藏,AI不仅要推演“对方会怎么走”,还要同时考虑“对方的棋子究竟是什么”。Stratego可能的棋子配置超过1033种。

已有方法常把问题转换到“公共信息”上,也就是只根据所有玩家共同看见的内容来组织决策。但论文指出,这类转换的成本会随隐藏信息量增加。即使在Texas hold’em中,仅两张私有牌也有1,326种组合;到了Stratego,规模更难处理。

它换了一套怎样的思路?

Ataraxos采用从零开始的自博弈强化学习与测试时搜索。强化学习是让AI反复对局,根据输赢调整策略,像靠复盘练棋;自博弈则是不依赖人类棋谱,让AI和自己的不同版本交手。测试时搜索,是在真正落子前再做一次针对当前局面的推演。

系统包含三部分。策略—价值网络负责提出动作并预测胜负;信念网络根据自博弈数据推测隐藏信息;搜索程序在对局时进一步修正策略。可以把它理解成三步:先凭经验提出候选行动,再估计看不见的棋子可能是什么,最后围绕这些判断向前推演。

论文披露的关键改动,是协调“正则化强度”和“策略更新幅度”。正则化可以理解为给学习过程加约束,避免策略乱晃。训练早期,Ataraxos使用更强的约束和更激进的更新;后期则同时减弱约束、缩小更新。作者认为,让两者保持匹配,可以压住不完美信息环境中容易出现的循环、发散或混乱,使自博弈持续进步。

20局比赛说明了什么?

论文报告,Ataraxos与Stratego获奖最多的选手Pim Niemeijer进行了20局比赛,取得15胜、1负、4和。作者称,这是最高水平比赛中前所未有的胜差,也是他们所知的Stratego首个“超人类”结果。训练成本据称只有数千美元;作为对照,论文称此前产业界曾投入多年、数十名研究者和数百万美元算力,仍未达到顶尖人类水平。

更值得关注的是迁移范围。同一套技术还被用于Barrage Stratego、Hanabi和斗地主:论文称其Barrage Stratego AI击败了三名多次夺得世界冠军的选手,Hanabi达到新的state of the art——即当时公开评测中的最佳水平,斗地主则击败了已有的最佳机器人。它们分别覆盖对抗、合作和团队游戏。

这使Ataraxos的意义不只是一项新游戏纪录。论文真正提出的是一种设计范式:学习策略、估计隐藏状态,再用搜索细化行动。如果它能在不同规则和互动关系下保持效果,强化学习与搜索就不再只适合“棋盘摊开”的世界,也可能更接近谈判、市场等信息不对称的决策环境。不过,论文只把这些现实领域作为问题背景,并未证明Ataraxos能够直接用于其中。

局限与未知

  • “首个超人类结果”带有“据作者所知”的限定。20局结果很突出,但论文材料没有给出统计显著性、选手当时的竞技状态或更广泛的人类对手测试,不能据此断言AI已普遍超过所有顶尖玩家。
  • “少若干数量级的算力和数据”“低成本、高样本效率”等说法缺少统一比较口径和完整数值。数千美元训练成本很醒目,但不能单独替代严格的效率比较。
  • 供稿节选只披露了方法框架和训练调度思路,没有展开搜索程序、信念网络及跨游戏评测协议的更多细节。Stratego、Hanabi和斗地主的成绩仍需分别结合基线版本与评测设置理解。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块