MIT联合团队AI战胜Stratego顶尖人类玩家,训练成本大幅降低
MIT等四校团队开发出AI系统Ataraxos,在隐藏信息的Stratego游戏中击败顶尖人类选手,为军事和商业决策提供新工具。该系统比谷歌DeepMind的DeepNash更强,训练样本少百倍以上,是首个在该游戏中战胜人类冠军的AI。
麻省理工学院、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员联合开发了一款名为Ataraxos的AI系统,在Stratego游戏中以明显优势击败了排名靠前的人类玩家,这是此前任何AI系统都未能做到的成就。Stratego是一种双人不完美信息游戏,对手棋子的身份保持隐藏,常被用作检验AI战略思维能力的基准。
Stratego中可能出现的棋子配置数以超10的66次方计,远多于国际象棋,这使得传统为扑克设计的AI技术难以应对。之前谷歌DeepMind的系统虽然投入数百万美元训练成本,仍未能战胜顶尖玩家。Ataraxos通过一种称为自对弈强化学习的技术训练,模型与自己多次对战来学习强大的"蓝图策略",同时设计了高效的算法,使其学习速度更快且避免陷入预测所有可能走法的困境。
研究团队表示,Ataraxos达到了比DeepNash更高的游戏强度,同时使用的训练样本不到其百分之一,自对弈游戏场次不到其三十分之一,在效率上有大幅提升。该系统还在其他规则不同的战略游戏中表现得优于顶尖人类玩家,展示了其适应多种场景的能力。
研究成果发表在《自然》杂志上。研究者认为,该AI系统可被改造用于帮助人类应对现实世界中的不完美信息问题,例如商业谈判或网络安全。正如论文通讯作者Gabriele Farina所说,现实中的不完美信息任务往往无法穷举所有可能性,通用且可证明有效的AI算法是一大进步。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。