AI 圈大事记

Dynin-Robotics 发布全模态扩散机器人模型

论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Dynin-Robotics 提出一种基于 Dynin-Omni 骨干的全模态统一扩散视觉-语言-动作模型。该架构将语言、视觉、目标和动作表示为离散 token,通过共享轨迹模型实现动作预测、未来观测预测及终端状态预测。模型在约 133 万条轨迹上持续预训练,并在 Franka Research 3 机器人上实现 78.4% 的平均成功率。优化的并行实现将动作解码加速了 29.2 倍。

为什么值得看

统一多模态预测接口,显著提升机器人任务成功率与推理速度。

数据集

信源1

  1. [1]arXiv cs.AI一手信源Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

关键事实

  • 模型在约 133 万条轨迹上持续预训练,涵盖 48 个 Open X-Embodiment 数据集。[1]

  • 在 Franka Research 3 机器人上,四种操作条件平均成功率达 78.4%。[1]

  • 优化的块并行实现使模型侧动作解码速度最高提升 29.2 倍。[1]

  • 结合目标指导与联合去噪的解码方式优于单一动作解码。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。