研究提出GGSD框架,通过自博弈发现人类可直接操控的智能体技能
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
GGSD框架将技能发现建立在竞技自博弈上,使层级智能体与过去的自己对战。高层策略从少量离散技能中选择,底层策略执行对应行为。训练后人类可接管高层直接用这些离散技能控制智能体。技能转换能涌现出连招行为,扩展表达力。在Ant、Franka-arm和Unitree G1环境中,人类可用GGSD产出的技能组合,无额外训练即解决Maze与CubePush等未见任务。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载技能发现与自博弈机制
现有无监督技能发现方法往往无法同时实现语义区分、可解释与富有表现力。GGSD框架将技能发现过程置于竞技游戏的自博弈中,让层级智能体与过去的自身版本对战。高层策略负责从少量离散技能集中做选择,而受技能条件约束的底层策略则学习执行对应的具体行为。这种机制使得发现的技能天然具备紧凑抽象,无需依赖底层动作即可控制具身智能体。
人类接管与涌现连招
该框架的核心优势在于训练完成后,人类能够直接替换高层策略,通过相同的离散技能集操控智能体。尽管高层动作数量很少,但不同技能之间的转换能够自发涌现出连招行为,从而将行为表达力扩展到单一技能原语之外。这意味着人类玩家可以利用少量高层指令,组合出丰富且连续的复杂运动序列。
跨环境零样本任务验证
研究在Ant、Franka-arm以及Unitree G1三种环境中验证了GGSD的有效性。实验表明,由GGSD生成的人类可玩技能具备良好的组合性。人类测试者利用这些技能进行组合,在无需任何额外训练的情况下,成功解决了Maze和CubePush等此前未见的任务,证明了该技能集的泛化能力与实用控制潜力。
为什么值得看
解决无监督技能发现难以同时满足语义区分与可解释性的痛点,实现人类零样本接管控制。
智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
