Schema框架通过程序归纳提升LLM探索未知环境能力

论文AI 评分 85/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对LLM智能体在规则不明环境中难以紧凑记录环境运作方式的问题,Schema框架引入交互式程序归纳机制,将智能体对环境的理解表达为可执行程序。该框架包含持久化程序工作区及用于校验、规划与执行的一组接口。在相同基座模型下,Schema将ARC-AGI-3的RHAE指标从58.7%提升至99.2%,完全解开DiG-bench公开测试集全部游戏,并在MazeBench上达到前50名人类选手的中位表现。消融实验证实了各组件的有效性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

程序归纳替代自然语言

现有LLM智能体在规则未知的陌生环境中执行任务时,常以自然语言记录探索发现,这种方式难以提供关于环境运作机制的紧凑且显式的表达。受科学家将观察结果组织为可测试预测理论的启发,Schema框架采用交互式程序归纳来组织学习与行动。智能体自主决定探究方向与行动方式,并将对环境不断演进的理解直接表达为可执行程序,从而更精确地刻画环境规则。

框架架构与执行验证

Schema框架的核心架构包含一个持久化程序工作区以及一小组接口。这些接口负责三项关键功能:首先,依据交互历史校验工作区中的程序;其次,在已验证的程序内进行规划;最后,在逐步验证的监督下执行这些规划。这种设计确保了智能体在未知环境中的行动具备可检验性与可预测性,消融实验也确认了工作区及各接口组件对整体性能的切实贡献。

基准测试性能跨越式提升

在相同基座模型条件下,Schema框架带来了显著的性能飞跃。在ARC-AGI-3测试中,其RHAE指标从原先的58.7%大幅跃升至99.2%。同时,该框架成功解开了公开DiG-bench测试集的全部游戏,达成100%的解决率。在MazeBench基准上,Schema的表现已追平前50名人类选手的中位水平。这些数据表明,程序归纳机制在未知机制发现任务上具备极强优势。

为什么值得看

将LLM对环境的认知从自然语言转为可执行程序,大幅突破未知规则下的推理瓶颈,ARC-AGI指标近乎满分。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Schema: Discovering Unknown Environments via Agentic Program Induction

关键事实

  • Schema框架将LLM智能体对环境的理解表达为可执行程序,而非自然语言记录[1]

  • 在相同基座模型下,Schema将ARC-AGI-3的RHAE从58.7%提升至99.2%[1]

  • Schema解开了100%的公开DiG-bench游戏[1]

  • 在MazeBench上,Schema达到了前50名人类选手的中位表现[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。