VisionWeave让MLLM原生支持弹性视觉表征,省43%token保98…

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

多模态大模型将视觉输入编码为固定大小token成本高昂。VisionWeave赋予模型端到端学习视觉表征分配粒度的原生能力,由门控空间池化器和粒度路由器构成。基于Qwen3.8-27B,该方法按内容自适应调整,平均节省43.0%的token,在八项基准上保留98.9%的原始性能,而固定减半的剪枝基线仅保住88%。部署于SGLang引擎时,吞吐量提升2.3倍,平均TTFT与TPOT分别降低54.4%和60.6%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

弹性视觉表征机制

现有多模态大模型将视觉输入编码为固定大小patch token,忽视了视觉信息分布不均的特性,下采样会丢失细节,现有token剪枝方法在内容自适应粒度与任务泛化上存在局限。VisionWeave提出弹性视觉表征编织,使基础模型端到端学习在何处及以何种粒度分配视觉表征。该架构包含两个核心组件:门控空间池化器在共享MRoPE坐标内构建粗粒度表征与原生细粒度表征;粒度路由器学习两者的内容自适应分配。

性能与效率表现

研究通过自蒸馏在Qwen3.5-4B上验证该能力,并扩展至Qwen3.8-27B规模,训练消耗超3万A100 GPU小时。基于Qwen3.8-27B,VisionWeave按视觉内容自适应调整token节省量,平均节省43.0%的token,在八项基准测试中保留了98.9%的原始性能。作为对比,设定固定50%节省目标的token剪枝基线仅能保留88%的性能。评估证实该方法在多任务、分辨率及视频帧下具备稳健的效率与质量权衡。

推理部署加速效果

在实际推理服务场景中,VisionWeave部署于SGLang服务引擎时取得显著加速。吞吐量实现2.3倍增益,平均首token时间(TTFT)降低54.4%,平均每token生成时间(TPOT)降低60.6%。这表明该技术不仅在离线基准测试中维持模型性能,更能转化为实际部署中可观的推理效率提升与延迟下降。

为什么值得看

显著降低MLLM视觉处理计算成本,在几乎无损性能前提下大幅提升推理吞吐并降低延迟。

Qwen大模型多模态蒸馏GPU

信源1 家

  1. [1]arXiv cs.AI一手信源VisionWeave: Weaving Elastic Visual Representations as a Native Capability of MLLMs

关键事实

  • VisionWeave由门控空间池化器和粒度路由器组成,在共享MRoPE坐标内构建粗细粒度表征并学习内容自适应分配[1]

  • 基于Qwen3.8-27B,平均节省43.0%的token并保留98.9%的原始性能,固定减半50%的剪枝基线仅保留88%性能[1]

  • 在SGLang部署实现2.3倍吞吐增益,平均TTFT降54.4%,平均TPOT降60.6%[1]

  • 通过自蒸馏在Qwen3.5-4B验证并扩展至Qwen3.8-27B,耗费超3万A100 GPU小时[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。