WorldSolver基准发布:评估LLM生成物理求解器能力

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

研究团队提出WorldSolver基准,包含168项模拟任务,源自61篇经典图形学论文,覆盖7个物理领域。任务要求智能体补全求解器代码以模拟动态系统。评估涵盖执行、视觉保真度与物理合理性三维度。前沿模型表现不佳,GPT-5.6-Sol与Claude-Opus-5得分仅48.7%和46.7%,表明生成可执行且符合视觉与物理规律的求解器极具挑战。

为什么值得看

揭示顶级大模型在物理规律理解与代码实现上的短板,为具身智能等领域的模拟器开发指明攻坚方向。

GPTClaude智能体论文

信源1 家

  1. [1]arXiv cs.AI一手信源WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?

关键事实

  • WorldSolver基准包含168项模拟任务,源自61篇经典图形学论文,覆盖7个物理领域[1]

  • 任务要求智能体在固定代码脚手架中补全求解器实现[1]

  • 评估维度包括执行检查、视觉保真度和物理合理性[1]

  • GPT-5.6-Sol和Claude-Opus-5总体得分分别为48.7%和46.7%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。