AI 圈大事记

GameHorizon Suite发布:含5千小时AAA游戏数据集及评测基准

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

为解决现有游戏AI评测覆盖面窄、缺语言指令或方差高等问题,研究团队推出GameHorizon套件。其包含可扩展的多时间跨度指令标注管线,以及首个大规模AAA游戏数据集,含21款游戏、百名专家录制的5千小时对齐视频、动作与指令。配套基准支持可复现的离线评测与逐步在线测试,以验证离线得分与实际表现的一致性。团队对47个模型超百万次调用评估,揭示了任务难度层级与模型能力差异,将开源数据集与基准。

为什么值得看

提供首个大规模AAA游戏多时间跨度对齐数据集与可复现评测基准,填补游戏AI综合能力评估空白。

对齐数据集

信源1

  1. [1]arXiv cs.AI一手信源GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

关键事实

  • GameHorizon-Data是首个大规模AAA游戏数据集,包含21款游戏、100名人类专家录制的5000小时视频、动作与多时间跨度指令对齐数据。[1]

  • GameHorizon-Bench提供可复现的离线评测与逐步在线测试,在线测试用于验证离线得分是否反映实际游戏能力并定位长跨度失败步骤。[1]

  • 基于该套件对47个模型进行超一百万次调用评估,揭示了任务难度层级与模型能力显著差异。[1]

  • 团队将开源数据集、标注管线与评测基准以促进未来研究。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。