VisionWeave让MLLM原生支持弹性视觉表征,省43%token保98…
论文AI 评分 82/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
多模态大模型将视觉输入编码为固定大小token成本高昂。VisionWeave赋予模型端到端学习视觉表征分配粒度的原生能力,由门控空间池化器和粒度路由器构成。基于Qwen3.8-27B,该方法按内容自适应调整,平均节省43.0%的token,在八项基准上保留98.9%的原始性能,而固定减半的剪枝基线仅保住88%。部署于SGLang引擎时,吞吐量提升2.3倍,平均TTFT与TPOT分别降低54.4%和60.6%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载弹性视觉表征机制
现有多模态大模型将视觉输入编码为固定大小patch token,忽视了视觉信息分布不均的特性,下采样会丢失细节,现有token剪枝方法在内容自适应粒度与任务泛化上存在局限。VisionWeave提出弹性视觉表征编织,使基础模型端到端学习在何处及以何种粒度分配视觉表征。该架构包含两个核心组件:门控空间池化器在共享MRoPE坐标内构建粗粒度表征与原生细粒度表征;粒度路由器学习两者的内容自适应分配。
性能与效率表现
研究通过自蒸馏在Qwen3.5-4B上验证该能力,并扩展至Qwen3.8-27B规模,训练消耗超3万A100 GPU小时。基于Qwen3.8-27B,VisionWeave按视觉内容自适应调整token节省量,平均节省43.0%的token,在八项基准测试中保留了98.9%的原始性能。作为对比,设定固定50%节省目标的token剪枝基线仅能保留88%的性能。评估证实该方法在多任务、分辨率及视频帧下具备稳健的效率与质量权衡。
推理部署加速效果
在实际推理服务场景中,VisionWeave部署于SGLang服务引擎时取得显著加速。吞吐量实现2.3倍增益,平均首token时间(TTFT)降低54.4%,平均每token生成时间(TPOT)降低60.6%。这表明该技术不仅在离线基准测试中维持模型性能,更能转化为实际部署中可观的推理效率提升与延迟下降。
为什么值得看
显著降低MLLM视觉处理计算成本,在几乎无损性能前提下大幅提升推理吞吐并降低延迟。
Qwen大模型多模态蒸馏GPU
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
