CORE方法提升MLLM组合推理能力
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决组合推理局限
现有的多模态大语言模型嵌入模型在处理组合检索任务时存在明显短板。这类模型往往难以区分包含相同概念但属性与对象绑定关系不同的场景。例如,面对视觉内容相似但语义逻辑不同的查询,模型容易产生混淆。然而,研究团队发现,如果将相同的模型骨干网络用作交叉注意力重排序器,它实际上能够有效解决上述区分难题。这种能力上的差异促使研究人员探索一种方法,试图将重排序器具备的这种精细的组合判断能力,迁移并蒸馏到嵌入模型之中,从而提升基础模型对复杂语义结构的理解与处理水平。
构建多层级训练
为了实现能力的迁移,该研究提出了名为 CORE 的框架。该框架的核心策略是合成涵盖五个组合匹配层级的候选列表,并引入 Rank-KL 目标函数。通过这种设计,训练过程旨在让嵌入模型能够精确复现重排序器所生成的细粒度排序结果。为了验证不同训练方法的有效性,研究团队制定了一套分级评估协议,并在相同的数据和调优预算下,对比了对比学习、成对 CoSENT 以及列表式 Rank-KL 这三种方法。实验结果显示,CoSENT 和 Rank-KL 在利用多层级监督信号方面均优于传统的对比学习,其中 Rank-KL 展现出了最为强劲的整体性能表现。
基准测试表现优异
在具体的性能评估中,基于该框架构建的 CORE-RERANKER-8B 模型在三个组合推理基准测试(COLA、SUGARCREPE++、NEGBENCH)上取得了 82.7% 的总平均分。这一成绩比 Jina-Reranker 高出了 10.7 个百分点,显示出显著的性能提升。与此同时,CORE-EMBED-8B 模型在所有参与评估的嵌入模型中获得了最高的总平均分,数值达到 0.666。值得注意的是,这种在组合推理能力上的增强并未以牺牲通用检索性能为代价,该模型在 MCMR 基准上也实现了性能的迁移,并且在 COCO 和 Flickr30K 数据集上保持了原有的检索效果。
为什么值得看
显著提升多模态大模型在复杂场景下的检索能力,解决属性-对象绑定问题
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
