研究提出MAPL框架优化大模型多智能体协作
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型多智能体协作中可靠奖励难以构建的问题,研究提出通用多智能体偏好学习框架MAPL。该框架通过比较当前解与各智能体生成的分散或集中解实现迭代更新,并实例化出MARLHF与MADPO两种算法。在协作写作、编程、工具使用及旅行规划任务上的测试表明,MAPL能提升协作质量与效率,性能接近具备固定明确奖励的MARL。其中MARLHF在多数任务上优于MADPO,但对数据覆盖度、模型及底层算法较敏感。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载多智能体协作奖励难题
在利用多智能体强化学习促进大语言模型协作时,构建可靠的奖励机制面临实际困难,因为完整且精确的评估指标通常难以获取且不易聚合。偏好学习可通过比较人类或AI的反馈来学习,为奖励构建提供了替代方案,但其向多智能体系统的扩展此前仍处于未被充分探索的阶段。
MAPL框架设计与实例化
为填补上述空白,研究从分散与集中协作视角构建了基于偏好的多智能体系统,并引入通用框架MAPL。该框架允许通过将当前解与各智能体生成的分散或集中解进行对比来实现迭代更新。研究将其具体实例化为两种算法:结合学习奖励模型的MARLHF,以及多智能体直接偏好优化MADPO。
实验表现与算法对比
在协作写作、编程、工具使用和旅行规划四项任务的实验中,MAPL有效提升了协作的质量与效率,其性能已接近具备固定且定义良好奖励的多智能体强化学习。在框架内部对比中,MARLHF在多数任务上表现优于MADPO,但其性能对数据覆盖范围、智能体与比较器模型以及底层强化学习算法的选择表现出较高的敏感性。
为什么值得看
为缺乏明确奖励信号的大模型多智能体协作提供了基于偏好学习的新解法,效果接近理想奖励模型。
大模型智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
