MindTopo 基准测试评估基础模型拓扑推理能力
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究团队发布 MindTopo 基准,用于评估基础模型在拓扑空间中的推理与规划能力。该基准基于认知科学与形式拓扑,包含连续性、分离性、顺序、包围和打结五种属性,涵盖 11,030 个实例和 13 种任务类型。测试涉及 14 个多模态大模型,结果显示所有模型在推理任务上的表现均优于规划任务,且最佳模型的表现仍远低于人类水平。
为什么值得看
填补了拓扑空间推理评估的空白,揭示了当前模型在动态规划上的短板。
大模型多模态基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
