研究提出GGSD框架,通过自博弈发现人类可直接操控的智能体技能

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

GGSD框架将技能发现建立在竞技自博弈上,使层级智能体与过去的自己对战。高层策略从少量离散技能中选择,底层策略执行对应行为。训练后人类可接管高层直接用这些离散技能控制智能体。技能转换能涌现出连招行为,扩展表达力。在Ant、Franka-arm和Unitree G1环境中,人类可用GGSD产出的技能组合,无额外训练即解决Maze与CubePush等未见任务。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

技能发现与自博弈机制

现有无监督技能发现方法往往无法同时实现语义区分、可解释与富有表现力。GGSD框架将技能发现过程置于竞技游戏的自博弈中,让层级智能体与过去的自身版本对战。高层策略负责从少量离散技能集中做选择,而受技能条件约束的底层策略则学习执行对应的具体行为。这种机制使得发现的技能天然具备紧凑抽象,无需依赖底层动作即可控制具身智能体。

人类接管与涌现连招

该框架的核心优势在于训练完成后,人类能够直接替换高层策略,通过相同的离散技能集操控智能体。尽管高层动作数量很少,但不同技能之间的转换能够自发涌现出连招行为,从而将行为表达力扩展到单一技能原语之外。这意味着人类玩家可以利用少量高层指令,组合出丰富且连续的复杂运动序列。

跨环境零样本任务验证

研究在Ant、Franka-arm以及Unitree G1三种环境中验证了GGSD的有效性。实验表明,由GGSD生成的人类可玩技能具备良好的组合性。人类测试者利用这些技能进行组合,在无需任何额外训练的情况下,成功解决了Maze和CubePush等此前未见的任务,证明了该技能集的泛化能力与实用控制潜力。

为什么值得看

解决无监督技能发现难以同时满足语义区分与可解释性的痛点,实现人类零样本接管控制。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Game-Guided Skill Discovery through Self-Play for Playable Agent Control

关键事实

  • GGSD框架通过自博弈机制发现可供人类直接操控的具身智能体运动技能[1]

  • 层级智能体中高层策略选择离散技能,底层策略执行行为,人类可替换高层进行控制[1]

  • 技能转换可涌现出连招行为,扩展了超越单一原语的表达力[1]

  • 在Ant、Franka-arm和Unitree G1环境中,人类可组合技能解决Maze和CubePush等未见任务[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。