AI 圈大事记

研究显示编程智能体在广义任务与运动规划中超越手工规划器

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

该研究探讨用编程智能体自动合成程序以解决广义任务与运动规划(TAMP)问题,使其在未见实例上泛化。在28个模拟环境中,Claude Code (Opus 5)与Codex (GPT-5.6 Sol及GPT-6 Astra)三种配置的平均成功率介于56%至95%,均优于手工规划器的47%。随物体数量增加,智能体程序的成功率依然更高,且单实例平均计算量比规划器少一个数量级。研究共评估980个生成程序在100个保留实例上的表现,总计9.8万次评估回合,并已公开全部代码与提示词。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

广义TAMP与智能体方案

任务与运动规划(TAMP)因离散决策与几何、运动学及动力学约束紧密耦合而难度较高。广义TAMP通过利用不同问题实例间的规律性来降低新实例的规划成本,但现有方法依赖大量特定领域的手工工程。本研究提出利用编程智能体自动化该流程:给定任务描述与模拟器访问权限,智能体在固定合成预算内通过与环境交互开发程序,随后冻结程序并在未见实例上评估泛化能力。日志显示智能体会利用交互来校准物理模型、测试边缘情况并优化策略。

评测设置与核心结果

研究在KinDER和PDDLStream的28个模拟环境中进行评测,物体数量超出原基准测试范围。参与测试的模型包括Claude Code (Opus 5)与Codex (GPT-5.6 Sol及GPT-6 Astra)。在16个有手工规划器的环境中,三种智能体配置的平均成功率介于56%至95%,显著超越手工规划器的47%,且优于单次生成及基于大模型的泛化规划基线。当物体数量增长时,智能体程序的成功率下降幅度小于规划器,且单实例平均计算消耗比规划器低一个数量级。

评估规模与资源公开

整个评测过程覆盖了980个生成程序,每个程序在100个保留测试实例上运行,总计完成98000个评估回合。研究团队已公开全部代码,包括提供给智能体的完整提示词,表明编程智能体可作为解决广义TAMP问题的强基线方案。

为什么值得看

证明大模型编程智能体可自动化泛化TAMP,大幅降低手工工程量与计算开销,为机器人规划提供新基线。

GPTClaude智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Coding Agents for Generalized Task and Motion Planning Problems

关键事实

  • 研究评估了Claude Code (Opus 5)和Codex (GPT-5.6 Sol, GPT-6 Astra)在28个模拟环境中解决广义TAMP问题的表现。[1]

  • 三种智能体配置的平均成功率为56%至95%,高于手工规划器的47%。[1]

  • 智能体生成的程序在物体数量增加时保持更高成功率,且单实例平均计算量比规划器少一个数量级。[1]

  • 研究共评估980个生成程序在100个保留实例上的表现,总计98000个评估回合。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。