NeurIPS 2026收录ViTeX-Bench视频场景文本编辑基准

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

ViTeX-Bench针对视频场景文本编辑(如替换店招文字同时保持原动态)缺乏成对数据与专用指标的问题,提供包含387个720p真实视频的数据集及三轴评估协议。协议含13个指标,分别衡量文本正确性、视觉时序质量与编辑局部性,并支持帕累托权衡对比。基于训练微调开源的ViTeX-Edit-14B编辑器,CharAcc达0.688,在视频原生编辑器中均值最高且文本裁剪Warp最低。八种基线测试表明同时实现文本准确、时序稳定与场景保留仍具挑战。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准与数据集构建

当前视频生成技术进展迅速,但针对保留原场景动态的精确局部编辑仍显不足。图像场景文本编辑已有充分研究,但视频领域在视觉质量、时序一致性与编辑局部性上尚存空白,且缺乏成对真实视频数据与专用评测指标。为此,ViTeX-Bench基准套件应运而生,其核心ViTeX-Dataset收录387个720p真实视频,均配备文本区域掩码与编辑指令。其中230个视频经人工审核提供流水线生成的成对编辑供训练使用,另157个视频作为冻结的评估集。

三轴评估与基线测试

该基准提出三轴评估协议,通过13个指标全面衡量编辑效果:文本正确性、视觉与时序质量、编辑局部性,每轴设一个主指标并进行帕累托权衡对比。为支撑指标解读,还引入OCR校准、人工评估及标注敏感性分析。对来自四个编辑家族的八种基线测试表明,同时实现文本准确、时序稳定与场景保留仍极具挑战。

开源模型与表现

研究同步发布开源参考编辑器ViTeX-Edit-14B,该模型基于成对训练集微调,采用运动对齐的字形-视频条件机制。在评测中,其字符准确率(CharAcc)达0.688,在受测视频原生编辑器中均值最高,同时在原始编辑器输出中取得最低的文本裁剪Warp值,为视频场景文本编辑的权衡研究提供了可复现基础。

为什么值得看

填补视频场景文本编辑缺乏专用数据集与多维度评估的空白,开源14B模型提供复现基线。

微调论文数据集

信源1 家

  1. [1]arXiv cs.AI一手信源ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing

关键事实

  • ViTeX-Bench包含387个720p真实视频,其中230个提供成对编辑用于训练,157个用于固定评估[1]

  • 评估协议包含13个指标,分三轴评估文本正确性、视觉时序质量与编辑局部性[1]

  • 开源参考编辑器ViTeX-Edit-14B的CharAcc为0.688,在视频原生编辑器中均值最高[1]

  • 该论文被NeurIPS 2026评估与数据集赛道接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。