AI 圈大事记

MindTopo 基准测试评估基础模型拓扑推理能力

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究团队发布 MindTopo 基准,用于评估基础模型在拓扑空间中的推理与规划能力。该基准基于认知科学与形式拓扑,包含连续性、分离性、顺序、包围和打结五种属性,涵盖 11,030 个实例和 13 种任务类型。测试涉及 14 个多模态大模型,结果显示所有模型在推理任务上的表现均优于规划任务,且最佳模型的表现仍远低于人类水平。

为什么值得看

填补了拓扑空间推理评估的空白,揭示了当前模型在动态规划上的短板。

大模型多模态基准测试

信源1

  1. [1]arXiv cs.AI一手信源MindTopo: Can Foundation Models Reason in Topological Space?

关键事实

  • MindTopo 包含 11,030 个实例和 13 种程序化生成的任务类型。[1]

  • 测试涵盖连续性、分离性、顺序、包围和打结五种拓扑属性。[1]

  • 所有被测 MLLM 在推理任务上的表现均优于规划任务。[1]

  • 最佳模型的表现仍远低于人类观察到的水平。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。