arXiv 2026 | PTCG-Bench: 大语言模型智能体能否掌握宝可梦集换式卡牌游戏

今天介绍的是发表在 arXiv 上的一项研究工作。复杂桌游能够检验智能体在不完全信息、长程规划和对抗决策中的综合能力,但现有基准往往难以同时评估策略水平、自我进化和智能体框架影响。PTCG-Bench 以宝可梦集换式卡牌游戏为环境,构建了包含合法动作验证、结构化观测、纵向对局和模块化框架消融的评测体系。实验显示,LLM 智能体已能取得非平凡的对局表现,最强与最弱模型之间存在 617 分 Glicko-2 差距,但多数自我进化方法尚不能稳定带来长期提升,且性能对框架设计高度敏感。这一基准为研究真实交互环境中的策略智能体提供了更具挑战性的测试场。

获取详情及资源:

0 摘要

对于战略复杂的棋盘游戏,人类玩家通常在进行数轮对局后便能迅速学习并制定策略。现实交互环境中的自主智能体也需要类似能力,但现有智能体基准往往无法充分刻画这类具有战略性且会随经验演化的决策场景。PTCG-Bench是一个基于Pokémon Trading Card Game(PTCG)的基准,从两个互补层面评估LLM智能体:(1)在单一复杂环境中的决策性能;(2)通过累积经验实现自演化的能力。基准还包含模块化harness消融,用于更清晰地解释智能体性能,避免将harness影响与模型能力混同。实验结果显示,LLM智能体虽能取得非平凡的游戏表现,但持续且稳定的自演化仍具挑战性,性能也对harness设计敏感。PTCG-Bench有望推动现实交互环境中harness感知型与自演化智能体的未来研究。

1 引言

长期以来,游戏一直是自主智能体的重要测试平台,推动了从Atari、Go、StarCraft II到近期Minecraft和Diplomacy中LLM智能体的发展。近年来,Pokémon也作为兼具竞技对战和开放式RPG玩法挑战性的领域受到越来越多关注。与此同时,基于游戏的基准已从ALE、TextWorld、ALFWorld和MineDojo等经典环境扩展到lmgameBench、Orak和PokeAgent Challenge等LLM智能体基准。然而,现有基准往往强调智能体能力的孤立侧面,对在同一战略环境中评估持续自演化的支持有限,或未能充分区分harness层面的影响与模型能力。因此,仍然需要一个能够联合评估战略性游戏、稳定自演化以及harness感知型智能体评测的统一基准。

表1|PTCG-Bench 与典型游戏类基准对比 缩写说明:IIR = 不完全信息推理,LHP = 长期规划,TNI = 文本-数值推理,SDM = 战略决策,LSE = 长期自我进化,MHS = 模块化支持,SGI = 单一游戏整合。“▲”表示部分覆盖,该能力存在于环境中或在部分任务中出现,但未作为核心要求明确评估。

针对这一空白,PTCG-Bench被构建为一个基于Pokémon Trading Card Game(PTCG)的基准。PTCG是一种战略性双人零和游戏,智能体必须对部分可观测游戏状态进行推理,在随机抽卡条件下决策,将文本卡牌效果与数值属性结合,并围绕对抗性交互进行规划。这一设定使PTCG-Bench能够评估LLM智能体是否可以在单一连贯游戏中结合不完美信息推理、长时程规划、文本-数值混合推理和战略决策,而不是将这些能力作为彼此孤立的子任务来求解。

图1|PTCG-Bench 环境概览 a. 左图:一张示例宝可梦卡牌,标注了关键属性包括 HP 和类型,以及影响游戏决策的能力和攻击描述。 b.右图:双人游戏棋盘,每位玩家拥有一个活跃位置、最多五个替补位置、奖品卡区域、牌堆、弃牌堆以及一手隐藏卡牌。智能体必须在可观测的自身棋盘状态上进行推理,同时从对手的一侧推断隐藏信息。

除初始性能外,PTCG-Bench还评估一项对自主智能体日益关键的能力:能否通过经验实现改进。对于部署在现实环境中的智能体,成功不能仅依赖静态指令或一次性任务求解;相反,智能体必须从试错中学习,巩固可复用经验,并随着环境变化调整未来决策。近期自我改进方法和基准提供了有用见解,但其中许多仍强调相对静态、短时程或完美信息设置。为更好近似现实环境中智能体面对的条件,PTCG-Bench在纵向评估协议下评估自演化智能体:自演化智能体进行一系列游戏,累积经验,并在多轮评估中检验这些经验是否能在动态环境中带来性能提升。

PTCG-Bench还支持对智能体harness设计进行受控分析。现代LLM智能体不仅依赖主干模型,也依赖外围harness设计。因此,模块化harness围绕三个关键因素构建:观测结构、合法动作掩码和上下文管理。通过对这些组件进行消融,PTCG-Bench可以量化harness选择如何影响游戏表现,并将这些影响与主干模型能力区分开来。

大规模实验结果显示,LLM智能体可以取得具有竞争力的游戏表现,但其性能会随模型和harness设计产生较大差异。PTCG-Bench给出了跨度较宽的智能体系统排序,最强与最弱的基于LLM的智能体之间存在617点Glicko-2评分差距。此外,PTCG-Bench暴露出现有自演化方法的局限:多数智能体无法随时间持续改进。

主要贡献如下:

• PTCG-Bench是一个基于PTCG的基准,可用于在涉及不完美信息、长时程规划和文本-数值混合推理的复杂环境中评估LLM智能体。

• 纵向评估协议用于评估自演化智能体能否累积跨游戏经验,并将其转化为后续决策改进。

• 模块化智能体harness包含可独立消融的组件,可在超出主干模型能力的层面对多种harness设计进行受控分析。

2 预备知识

2.1 Pokémon Trading Card Game

PTCG是一种双人、回合制、零和卡牌游戏,每名玩家使用一套60张牌的牌组,主要由Pokémon牌、Energy牌和Trainer牌构成。玩家设置一只Active Pokémon、可选的Benched Pokémon以及六张牌面向下的Prize牌,随后轮流发展场面、管理资源并攻击对手。玩家可通过拿完所有Prize牌、清除对手场上的所有Pokémon,或使对手从空牌库中抽牌来获胜。

PTCG对LLM智能体具有挑战性,因为它结合了隐藏信息、随机抽卡、动态合法动作和长时程资源规划。智能体必须解释自然语言卡牌效果,同时围绕HP、伤害、Energy费用和Prize数量等数值进行推理,并做出连续决策;这些决策的后果可能在多个回合中不断累积。这些属性使PTCG成为评估战略决策和基于经验改进的合适环境。

2.2 LLM智能体形式化

通过将对手策略吸收到环境动态中,一场PTCG对局可以建模为部分可观测马尔可夫决策过程(POMDP),其中完整游戏状态包含对手手牌、牌面向下的Prize牌和尚未揭示的牌库顺序等隐藏信息。在步骤t,智能体接收观测ot,维护交互历史ht=(o1,a1,,ot1,at1,ot),选择动作at并获得奖励rt。由于游戏状态并非完全可观测,智能体必须基于otht,而非完整状态采取行动。LLM智能体通过主干模型和外围harness共同诱导出策略。harness将观测和历史转换为prompt,约束或格式化可用动作,并将模型输出解析为可执行动作。由此得到的策略记为

atπθ,η(ot,ht),

其中,θ表示LLM主干模型,η表示harness设计。智能体的期望性能可写为

J(θ,η)=Eπθ,η[trt].

3 PTCG-Bench

PTCG-Bench从三个维度评估Pokémon Trading Card Game(PTCG)中的LLM智能体:(i)不完美信息和长时程战略交互下的决策;(ii)通过累积跨游戏经验实现的自演化;(iii)超出主干模型能力之外的harness设计贡献。此部分介绍游戏环境、自演化协议、模块化harness、评估锦标赛和评估指标。

3.1 基准环境

引擎实现。PTCG-Bench使用自定义PTCG引擎,以实现可复现的规则执行和合法动作验证。该引擎实现完整游戏评估所需的核心机制,从而为比较智能体系统提供一致环境。

牌组池。固定牌组池包含5套竞技牌组,覆盖不同战略原型,包括进攻型、控制型、组合技导向型和消耗型计划。该牌组池同时用于受控镜像对局评估和跨牌组泛化分析。

状态和动作空间。PTCG-Bench区分私有状态、公共状态和全局状态,以保留不完美信息。智能体可以观察自身私有区域和公共场面信息,而对手手牌、牌库顺序和Prize牌身份保持隐藏。动作空间定义为一组通过工具schema暴露的参数化游戏动作,包括打出或进化Pokémon、附加Energy、打出Trainer牌、攻击、撤退和跳过。每个动作都指定执行所需的参数,从而在智能体决策与游戏机制之间提供结构化接口。

3.2 智能体-环境接口

引擎在每个决策点暴露游戏状态,智能体由此接收部分观测。智能体harness将该观测与交互历史结合,并渲染为LLM可读取的prompt。主干LLM随后返回结构化动作请求,通常是包含动作类型及相应参数的工具调用。模型响应由harness解析,并由引擎根据当前合法动作集合进行检查。有效动作会被执行以推进游戏状态,非法请求则触发重试。该接口固定底层游戏执行,同时允许智能体系统在信息表示、历史使用和动作选择方式上发生变化。这种灵活性进一步支持对多个harness模块进行评估。

图2|PTCG-Bench 中的智能体-环境交互循环 在每个决策点,游戏引擎向智能体框架暴露当前状态和合法动作集合,框架将其转换为可被 LLM 读取的提示。骨干模型的响应由引擎解析、验证并执行,以推进游戏状态。

3.3 纵向评估协议

PTCG-Bench评估自演化智能体能否通过累积游戏经验实现改进。游戏被组织为多轮完整PTCG对局。每轮结束后,演化智能体可以更新持久状态,例如反思、战略摘要、记忆条目、修订后的prompt或技能文档。该协议将游戏内决策与跨游戏经验更新分离。通过跟踪相对于固定策略锚点的逐轮表现,可以分析累积经验是否会改进、保持或削弱后续对局表现。

3.4 模块化harness架构

在PTCG-Bench中,harness不被视为游戏引擎和LLM主干模型之间的中性包装器。既有工作表明,包括状态感知、上下文管理和动作执行在内的外围智能体脚手架,能够显著改变同一主干模型的被测能力。

因此,PTCG-Bench将harness分解为模块化组件,使关键的智能体-环境耦合因素能够独立消融。这种模块化分离有助于避免将被测性能与状态感知、上下文管理和动作执行的影响混同于主干模型能力。

3.5 评估锦标赛

PTCG-Bench针对不同评估目标使用两种锦标赛。固定智能体通过循环赛进行比较,其中每个配置都与其他所有配置对局,以在共享评分尺度上估计整体游戏强度。该设置支持对静态主干模型和harness配置进行直接比较。

图3|PTCG-Bench 中的评估锦标赛设计 a. 左图:固定策略智能体首先通过循环赛进行评估以获得评级,从中选出一组固定锚点基线。 b. 右图:自我进化智能体随后通过锚点锦标赛进行评估,每个进化策略在各轮中与冻结的锚点基线对战。

自演化智能体采用锚定锦标赛,因为同步策略更新会使循环赛评分尺度在各轮之间漂移。每个演化智能体与校准评分覆盖评分范围的固定策略锚点对局,随后可以更新其持久状态。因此,锚点对局在智能体快照之间保留稳定参考群体。由于锚点不变,逐轮评分变化主要反映演化智能体自身的变化。

3.6 评估指标

PTCG-Bench报告4项互补指标。

Glicko-2评分。Glicko-2被用作游戏强度的主要度量,并在随机对局结果下报告评分均值μ和评分偏差ϕ。固定智能体的评分根据循环赛记录估计,演化智能体的评分根据锚点对局估计,其中ϕ表示估计不确定性。

头对头胜率。头对头胜率是Glicko-2的可解释补充,可以揭示聚合评分可能掩盖的对局层面优势。

无效动作率。无效动作率衡量智能体在重试或回退之前产生非法或无法解析动作的频率,对harness消融尤其重要。

工具调用次数。工具调用次数衡量交互成本,统计决策过程中调用的动作尝试和操作。它用于补充说明配置效率。

4 实验

4.1 实验设置

为回答以下研究问题,开展了综合实验:(RQ1)PTCG-Bench能否区分LLM智能体之间的战略能力差异?(RQ2)PTCG-Bench能否衡量连续对局中的自演化?(RQ3)harness设计对智能体性能有多大影响?

LLM主干模型。评估覆盖来自5个模型家族的10个主干模型,每个家族配对一个前沿变体和一个成本高效变体:Gemini 3.1 Pro和Gemini 3 Flash、Claude Sonnet 4.6和Claude Haiku 4.5、DeepSeek V4 Pro和DeepSeek V4 Flash、GPT-5.4和GPT-5.4 Nano,以及Qwen3.6 Plus和Qwen3.5 Flash。除非另有说明,所有智能体均使用相同的ReAct风格harness。

评估配置。固定智能体实验采用循环赛,包含10个LLM智能体和两个非LLM参考智能体Random与Heuristic;二者分别按均匀权重和预定义权重从合法动作中采样。每一对智能体进行M=5场游戏,每个锦标赛共生成330场游戏。自演化评估采用锚定锦标赛。评分使用Glicko-2计算,除非另有说明,均采用镜像对局。

4.2 主干模型战略能力

为回答RQ1,在固定ReAct harness和镜像对局设置下,PTCG-Bench被用于检验是否能够区分主干模型层面的战略差异。10个主干模型和固定能力锚点的Glicko-2评分被共同纳入分析。

图4|统一 ReAct 框架下的 PTCG-Bench 锦标赛结果 a. 左图:LLM 骨干模型和固定能力锚点智能体的 Glicko-2 评级(μ ± φ),所有智能体均初始化为 μ = 1500、φ = 350;误差条表示评级偏差。 b. 右图:成对胜率热图,每个单元格表示行智能体相对于列智能体的胜率。更高评级和更冷的热图数值表示更强的对战能力。

PTCG-Bench产生宽泛且分辨良好的评分分布。在基于LLM的智能体中,评分从GPT-5.4 Nano的1237到Gemini 3.1 Pro的1854,对应617点Glicko-2差距。这一跨度显著超过大多数单个智能体的评分偏差,表明PTCG-Bench能够按游戏强度区分LLM智能体,而不是将它们压缩在狭窄性能区间内。头对头胜率进一步表明,同一模型家族中的前沿变体会稳定优于其成本高效版本,说明PTCG-Bench捕捉到的是有意义的能力差异,而非锦标赛噪声。

游戏强度并不由推理成本决定。每场游戏的推理成本与Glicko-2评分之间呈非单调分布,说明更高成本不一定带来更强对局表现,也表明PTCG-Bench能够揭示LLM智能体之间的实际成本-性能权衡。

图5|十个 LLM 骨干模型的成本-评级权衡 y 轴表示 Glicko-2 评级均值 μ,x 轴表示每局游戏的推理成本(美元)。越靠近左上区域的模型,在更低成本下表现出更强的对战能力。

PTCG-Bench捕捉到通用基准无法完全反映的能力。PTCG-Bench排序与LiveBench、SWE-Bench Pro和GPQA等其他LLM评测报告的模型排序进行了比较,结果只呈部分一致。尤其是,在通用语言理解或基于偏好的评估中表现更强的模型,并不总是获得同比例更高的PTCG-Bench评分。这种差异表明,PTCG-Bench评估的是超出静态语言理解的能力,特别是不完美信息推理、长时程规划和不确定性下的战略决策。

4.3 自演化

为回答RQ2,固定锚点和稳定评分尺度被用于评估PTCG-Bench能否跟踪连续对局中的自演化。

演化智能体配置。5个代表性自演化基线在相同PTCG-Bench harness下接受评估:Reflexion、ExpeL、长期记忆、prompt演化和技能库演化。由于PTCG涉及长时程、延迟且高方差的结果、隐藏信息、随机卡牌顺序和依赖对手的策略转移,直接移植基于rollout或搜索的方法会带来高成本且不稳定。因此,这些基线在机制层面进行了适配。所有配置使用相同主干模型和harness,以隔离自演化效应。

锚定自演化协议。每个演化配置接受R=8轮评估。每轮中,它会分别与12个固定锚点各进行2场游戏:来自RQ1的10个静态LLM智能体,以及Random和Heuristic智能体。非演化的同主干ReAct智能体也作为静态参考进行报告。这样每个配置产生24场游戏,每轮共有N=120场演化智能体游戏。每轮结束后,每种机制都会根据累积轨迹更新其持久状态,随后下一快照再与同一组锚点进行评估,从而将评分变化保持在稳定参考尺度上。

所得评分轨迹与锚定基线评分以及非演化同主干ReAct参考进行了比较。锚定评分范围显示,当前自演化基线仍有大量提升空间,但五种机制都没有在8轮中表现出一致的单调改进。评分反而波动,未形成稳定上升趋势,且到评估结束时,没有任何演化配置能够可靠超过非演化同主干参考。这些结果表明,PTCG-Bench揭示了当前自演化机制的不完整性:在缺少密集奖励或可验证真实解的长时程、不完美信息游戏中,现有智能体仍难以提取可复用的战略知识。

图6|使用 Qwen3.5-Flash 的五种进化智能体配置在自我进化轮次中的 Glicko-2 评级轨迹 a. 总结所有进化配置相对于锚定评级范围的表现,灰色虚线表示锚定最高和最低评级,点线表示非进化同骨干参考。 b–f. 提供各方法与非进化 ReAct 基线的特定方法对比,阴影区域表示评级不确定性带。

4.4 模块化harness消融

为回答RQ3,harness设计是否以及在多大程度上影响被测智能体性能接受检验。LLM主干模型、牌组池和锦标赛设置保持固定,同时对支配状态表示、动作执行和上下文管理的关键harness选择进行消融。

harness模块。这三个模块之所以被重点分析,是因为它们对应harness影响游戏表现的主要阶段:智能体如何感知状态,如何将决策锚定为可执行动作,以及如何跨回合保留时间信息。

• 观测结构(H1):以最小格式化的原始状态或游戏日志表示替代结构化状态描述。

• 合法动作掩码(H2):移除引擎计算得到的合法动作集合,要求智能体从当前状态中推断有效动作和参数。

• 上下文管理(H3):保留当前状态和合法动作,但移除近期轨迹历史。

主harness消融。完整harness使用结构化观测、合法动作掩码和上下文窗口感知的历史截断。它与三个单组件消融和一个最小harness进行比较。最小harness移除全部三类接口支持:使用非结构化观测,禁用合法动作掩码,并且不提供近期历史。

表2|主要框架消融结果 所有配置均使用相同的 LLM 骨干模型和镜像匹配锦标赛设置。μ 表示 Glicko-2 评级均值,∆μ 相对于完整框架测量。括号中的数值通过 RQ1 排名中相邻 LLM 骨干模型之间的中位评级差距(55 个评级点)对评级下降进行归一化,该差距也在最后一行报告,作为参考尺度。Inv. Rate 表示重试或回退前非法或不可解析动作所占比例。

消融结果显示,harness设计会影响被测能力。移除结构化观测会造成中等幅度的33点评分下降,并带来更多无效动作;相比之下,移除合法动作掩码或近期历史会分别使评分下降118点和115点,前者提高无效率,后者使工具调用次数增加近5倍。这些下降幅度超过RQ1中典型相邻主干模型差距,并接近若干同家族模型层级差距。因此,harness设计对被测游戏强度具有实质影响,是使用PTCG-Bench评估LLM智能体系统时的核心因素。

4.5 跨牌组泛化

跨5种牌组原型的逐牌组镜像对局泛化也接受评估,以测试被测主干模型差异在不同战略设置下是否仍然存在。主要智能体排序在各牌组上大体保持一致,表明被测差异并非单一镜像牌组的产物。

5 相关工作

5.1 自演化LLM智能体

近期工作探索了通过交互历史、反思性反馈和可复用经验实现改进的自演化LLM智能体。GEPA根据反思性轨迹分析演化prompt;A-MEM组织自适应记忆以实现长期改进;EvoSkill则从执行失败中优化可复用技能。这些工作表明,智能体不仅可以通过模型层面的训练获得改进,也可以通过演化prompt、记忆和技能实现改进。

5.2 LLM游戏智能体基准

游戏是重要测试平台,因为它们需要感知、记忆、规划和长时程决策。LMGame-Bench借助模块化感知、记忆和推理组件评估多样化游戏,而Orak覆盖多个视频游戏类型,用于系统化智能体训练和评估。其他基准强调特定挑战:TCG-Bench是一个抗污染、难度可扩展的多语言卡牌游戏基准,PokeAgent Challenge则面向部分可观测性和长上下文战略推理下的竞技决策。

6 结论

PTCG-Bench是一个用于在现实且复杂的游戏环境中分析LLM智能体的综合基准。通过结合长时程不完美信息游戏和纵向评估协议,PTCG-Bench为在延迟反馈、随机性和对手交互下评估自演化提供了受控设置。跨10个LLM主干模型和多种自演化机制的实验显示,当前智能体可以取得有意义的游戏表现,但累积经验尚不能可靠转化为稳定性能收益。harness消融进一步表明,接口设计会实质性影响被测能力,这凸显了在智能体系统层面分析自演化的必要性。这些发现突显出PTCG是未来自演化智能体研究的具有挑战性的测试平台。

7 局限性

PTCG-Bench旨在支持复杂集换式卡牌游戏中LLM智能体系统的受控评估,当前设置侧重于使性能差异具有可解释性的条件。具体而言,固定牌组池和以镜像对局为主的评估用于减少非对称对局影响,同时在固定LLM主干模型下分析基于经验的prompt、记忆和技能更新。这些选择能够在同一环境中隔离主干模型能力、harness设计和自演化机制,但并未穷尽战略适应的完整空间。未来扩展可以在保留同一受控评估框架的同时,纳入开放牌组构建、任意跨牌组对局、更长经验流或参数层面的学习。

8 伦理考虑

在构建PTCG-Bench时,公开可用的Pokémon Trading Card Game(PTCG)信息被使用,包括卡牌名称、机制、描述和图像。所有材料仅根据适用版权法中的合理使用/研究例外原则,用于非商业学术研究目的。该基准不用于商业应用,也不声称与The Pokémon Company、Nintendo或相关实体存在任何关联、赞助或背书关系。版权持有人的知识产权受到尊重,数据以转换性方式用于语言模型基准测试。数据集将仅面向研究用途发布,使用者应遵守所有相关知识产权规定。PTCG-Bench使用的数据来源于虚构卡牌游戏材料,不涉及人类受试者、用户生成的个人数据或能够唯一识别真实个人的信息。收集到的数据经过审查,以确保不包含个人身份信息。ChatGPT被用于协助语言编辑并提升稿件清晰度。所有AI辅助内容均经过审查和验证,最终论文责任由论文团队承担。