研究进展·Ars Technica AI
CMU等团队AI首次击败顶级人类Stratego玩家,训练成本仅数千美元
卡内基梅隆大学等机构研究人员开发出AI Ataraxos,以15胜1负4平的战绩击败世界顶级Stratego玩家Pim Niemeijer。其训练仅用16块GPU,成本数千美元。关键在于加入第二个神经网络来猜测隐藏棋子身份,解决了不完全信息游戏的难题。
Stratego是一款经典的不完全信息棋盘游戏,每方有40枚棋子,从元帅到间谍,还有炸弹和军旗,玩家通过夺取对方军旗获胜,但对手的棋子身份只有碰撞时才揭示。此前DeepMind等机构一直未能让AI稳定击败顶级人类玩家,而这次卡内基梅隆、MIT、NYU和斯坦福的联合团队做到了。
Ataraxos通过自我对弈学习,共进行了1.63亿局游戏,但与DeepMind的DeepNash不同,它在训练后期采用更精细的策略调整,并在每次行动前引入第二个神经网络(信念模型)来猜测对手隐藏棋子。这使得AI能在庞大搜索空间中高效决策。
Ataraxos在2025年世界锦标赛中击败了38/40的挑战者,并让人类冠军在20局中仅获胜一次它的风格沉稳冷静,甚至能像人类一样虚张声势,但更擅长执行到底。研究团队指出,该AI的训练成本远低于DeepNash(后者耗资估300-450万美元),仅需数千美元和16块GPU。
#AI#游戏#神经网络
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。