新基准SpeedrunBench用游戏速通测试LLM智能体策略能力

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究人员推出SPEEDRUNBENCH基准,通过9款电子游戏的速通玩法检验前沿大语言模型智能体。智能体需反复优化策略、反思表现并利用已获知识进行长程推理,以追求更短通关时间。实验表明,在简单平台游戏中,前沿智能体成绩接近人类世界纪录;但在预算受限下面对耗时更长、机制更复杂的游戏时,仍落后于人类。该基准因总有更快通关时间待发掘,具备抗饱和评估特性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

速通场景检验策略构建

当人类已有解决方案不足以应对缺乏上下文或训练数据的问题时,智能体开发复杂策略的能力至关重要。该研究借助电子游戏速通这一社区实践来考察智能体的策略构建水平。速通要求参与者在特定条件下寻找最快通关方式,这往往需要发掘非正统玩法,从而深刻理解并精通底层游戏机制。SPEEDRUNBENCH正是基于此理念构建的评测工具。

基准要求与实验表现

要在SPEEDRUNBENCH中取得佳绩,智能体必须持续改进自身策略、对表现进行反思、利用积累的知识,并跨越长程动作序列进行推理,以解决越来越难的挑战——即超越自身及他人的通关速度。实验结果显示,前沿智能体在简单平台游戏中的表现已逼近人类世界纪录;然而,在实际计算预算限制下,面对流程更长、机制更复杂的游戏,智能体依然无法匹敌人类表现。

抗饱和评估与测试价值

由于速通领域几乎永远存在更短的通关时间等待被发现,SPEEDRUNBENCH展现出抗饱和的评估优势。这意味着该基准不会轻易被模型刷至满分上限,能够持续区分不同模型的能力差异。研究认为,该基准可作为研究智能体策略构建能力的有效测试床,为衡量前沿大语言模型在复杂长程任务中的优化极限提供了新尺度。

为什么值得看

提供抗饱和的长程策略优化评测新视角,揭示LLM在复杂长程任务中仍落后人类的现状。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源SpeedrunBench: Challenging LLM Agents with Video Game Speedrunning

关键事实

  • SPEEDRUNBENCH包含9款不同的电子游戏用于评估前沿大语言模型智能体。[1]

  • 在简单平台游戏中,前沿智能体表现接近人类世界纪录。[1]

  • 在更长更复杂的游戏中,受限于实际预算,智能体表现仍落后于人类。[1]

  • 该基准具有抗饱和的评估特性,因为几乎总有更快的通关时间可被发掘。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。