WorldSolver基准发布:评估LLM生成物理求解器能力
论文AI 评分 75/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究团队提出WorldSolver基准,包含168项模拟任务,源自61篇经典图形学论文,覆盖7个物理领域。任务要求智能体补全求解器代码以模拟动态系统。评估涵盖执行、视觉保真度与物理合理性三维度。前沿模型表现不佳,GPT-5.6-Sol与Claude-Opus-5得分仅48.7%和46.7%,表明生成可执行且符合视觉与物理规律的求解器极具挑战。
为什么值得看
揭示顶级大模型在物理规律理解与代码实现上的短板,为具身智能等领域的模拟器开发指明攻坚方向。
GPTClaude智能体论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
