UMM-Reflection让统一多模态模型学会原生反思,GenEval提升1…
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
统一多模态模型能看且能生成图像,原则上可修复自身生成错误,但需在整条反思轨迹上联合学习诊断文本与图像生成。常规SFT无法找到高成功率修复路径,仅优化单一模块的朴素RL会错失大部分增益。UMM-Reflection将RL应用于统一模型内的完整反思轨迹:同源轨迹共享初始图像,通过组相对优势对比反思策略,用轨迹级优势同时更新反思词元与基于流的修正,避免逐轮信用分配的组合爆炸。在BAGEL上,该方法较SFT在GenEval提升12.05点,且增益泛化至WISE、OneIG-Bench与T2I-CompBench++三个未参与训练的基准。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载统一模型反思闭环
统一多模态模型兼具视觉理解与图像生成能力,理论上具备自我修复生成缺陷的潜力:诊断图像错误、执行修正、观察结果并再次诊断。然而,修正是否有效仅在图像渲染后才可知晓,故反思文本与图像生成必须在完整循环上联合学习。仅对反思轨迹做监督微调虽能提供冷启动,却无法发掘高成功率的修复路径;而仅优化渲染器或单一头部的朴素强化学习会遗漏大部分潜在增益。
交错强化学习机制
UMM-Reflection将强化学习引入统一模型内的完整反思轨迹。其核心设计在于:兄弟轨迹共享同一初始图像,利用组相对优势来对比不同反思策略的优劣;同时,采用轨迹级优势同时更新反思词元与基于流的修正操作。这一机制有效规避了逐轮信用分配带来的组合爆炸问题。与单轮编辑或依赖外部评判器的流水线不同,该方法允许信用跨轮次流动并传递至同一模型的生成与理解双重角色,且推理阶段无需额外验证器。
实验表现与泛化
在BAGEL模型上的实验表明,UMM-Reflection相较于SFT在GenEval基准上取得了12.05分的提升。更为关键的是,这种性能增益成功泛化到了三个未参与训练的评测集上:WISE提升10.97分,OneIG-Bench提升3.48分,T2I-CompBench++提升4.63分。这证明了该反思学习机制不仅提升了特定任务的生成质量,还增强了模型在未见分布上的泛化能力。
为什么值得看
无需外部评判器即可实现跨轮次信用分配,让统一模型内生反思闭环,显著提升生成质量与泛化能力。
多模态强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
