AI攻克隐藏信息游戏Stratego:双神经网络突破信息迷雾

AI攻克隐藏信息游戏Stratego:双神经网络突破信息迷雾

在人工智能征服游戏的漫长清单上,国际象棋、围棋、扑克相继被攻克,但有一款看似简单的棋盘游戏却顽固地抵挡住了AI的进攻——这就是战略棋(Stratego)。近日,来自Ars Technica的报道揭示了这一僵局的突破:研究人员通过引入第二个神经网络来推测隐藏棋子的身份,终于让AI掌握了这款信息不完全的博弈游戏。

战略棋:AI的"信息迷雾"难题

对于不熟悉战略棋的读者,这里做一个简要介绍。战略棋是一款两人对弈的棋盘游戏,每位玩家拥有40枚棋子,代表不同军衔的军事单位——从元帅、将军到侦察兵、炸弹和军旗。游戏的目标是夺取对方的军旗或消灭对方所有可移动的棋子。

与国际象棋或围棋不同,战略棋的核心难点在于:你无法看到对手棋子的真实身份。当对手的棋子向你移动时,你不知道那是一位元帅还是一名侦察兵,是炸弹还是军旗。只有在双方棋子发生碰撞时,身份才会部分揭晓。这种"隐藏信息"机制使得战略棋更接近于现实世界中的军事对抗和商业竞争——在信息不透明的情况下做出决策。

战略棋的挑战在于,AI不仅需要决定"怎么走",还需要同时在脑中构建一幅关于对手棋子身份的"信念地图",并随着每一次碰撞不断更新这幅地图——这与围棋或国际象棋中所有信息都摆在棋盘上的情况截然不同。

为何战略棋长期难倒AI

在不完全信息博弈中,AI面临的核心问题是"状态空间爆炸"。在国际象棋中,AI可以通过搜索树评估每一步的后果;但在战略棋中,由于对手棋子的身份是未知的,AI必须考虑所有可能的棋子身份组合,这导致可能的状态数量呈指数级增长。

此前针对不完全信息博弈的成功案例——如DeepMind的AlphaStar在《星际争霸》中的表现,以及Libratus和Pluribus在德州扑克中的突破——都采用了不同的技术路线。德州扑克虽然也有隐藏信息(对手的手牌),但游戏结构相对标准化;而战略棋的隐藏信息维度更多,棋子身份、位置、移动历史都是推理的线索。

突破关键:第二个神经网络

根据报道,这次突破的核心在于架构创新。研究团队在传统的策略网络之外,增加了第二个神经网络,专门负责"猜测"对手隐藏棋子的身份。这个网络通过分析对手的移动模式、碰撞结果和游戏历史,动态更新对每个未知棋子的身份概率估计。

这种双网络架构的设计思路,类似于人类玩家在战略棋中的思维方式。有经验的人类棋手不仅考虑自己的走法,还会根据对手的行为模式推测其棋子布局——比如,如果对手的一个棋子一直在前线积极进攻,它很可能是高军衔单位;如果某个棋子突然停止移动或退后,它可能是炸弹或军旗。

第二个神经网络所做的,本质上就是将这种人类直觉形式化、算法化。它输出的不是单一的身份判断,而是一个概率分布——例如,"这个棋子有70%的可能是少校,20%的可能是上尉,10%的可能是炸弹"。策略网络则基于这个概率分布来选择最优行动。

更广泛的意义:AI与信息不透明决策

这项研究的价值远不止于攻克一款棋盘游戏。在现实世界中,绝大多数重要决策都发生在信息不完全的条件下——无论是军事指挥、商业竞争还是外交谈判,决策者都无法完全掌握对手的意图和资源。

战略棋AI的突破,为AI在信息不透明环境下的决策提供了新的范式。特别是在需要长期规划、动态推理对手意图的场景中,这种"信念建模+策略优化"的双网络架构具有广泛的迁移潜力。例如,在网络安全领域,AI需要推测攻击者的意图和下一步行动;在自动驾驶中,AI需要预测其他车辆和行人的未来行为。

编者按:不完全信息博弈——AI的下一个前沿

回顾AI在游戏领域的发展历程,我们可以清晰地看到一条从"完全信息"到"不完全信息"的演进路径。从深蓝击败卡斯帕罗夫(国际象棋),到AlphaGo战胜李世石(围棋),再到Libratus征服德州扑克,每一步都代表了AI处理不确定性的能力跃升。

战略棋的攻克,标志着AI在这一路径上又迈出了坚实一步。但我们也应清醒地认识到,战略棋仍然是高度结构化的游戏——规则固定、动作空间有限。真实世界的不完全信息博弈远比这复杂:信息可能是模糊的、虚假的甚至故意误导的,博弈的规则也可能随时变化。

不过,每一次在受控环境中取得的突破,都为解决更复杂的问题积累了方法论。战略棋AI中"显式建模隐藏状态"的思路,很可能成为未来AI系统处理不确定性的一把钥匙。当AI学会在迷雾中做决策时,它离真正理解这个充满不确定性的世界就更近了一步。

本文编译自Ars Technica