AI 圈大事记

GenStream框架实现视频流99.9%带宽缩减

论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

GenStream框架提出了一种面向人物媒体的语义流式传输方案。该方案摒弃了传统像素传输,转而发送骨骼关键点、相机视角参数及静态3D背景模型等结构化元数据。客户端利用生成模型据此重建照片级逼真的人物图像并合成场景。在花样滑冰视频测试中,该方案相比HEVC标准实现了超过99.9%的数据流带宽缩减,为后编解码时代的智能流媒体奠定了基础。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

语义流式传输架构

传统视频编解码器通常对整帧画面进行重新编码,统一处理前景与背景像素,忽略了场景的语义结构,这在背景静态且运动集中于少数主体的场景中造成了带宽浪费。GenStream框架对此进行了革新,不再传输密集的视频帧,而是将场景编码为紧凑的结构化元数据。具体而言,系统传输的内容包括人物的骨骼关键点、相机视角参数以及一个静态的3D背景模型。这种传输方式将数据量压缩至极致,从根本上改变了视频流的构成要素。

生成式重建与压缩效果

在接收端,GenStream利用生成模型对接收到的元数据进行处理。模型根据骨骼关键点重建照片级逼真的人物形象,并将其按照原始视角合成到3D背景场景中。这种范式实现了极端的压缩效果。根据在奥运会花样滑冰影像上的部分验证,GenStream在连续数据流传输中,相比HEVC标准实现了超过99.9%的带宽缩减。尽管该方案将显著的计算负荷转移到了客户端,且在泛化能力上面临挑战,但其证明了在极低数据量下保持高感知保真度的潜力。

应用前景与局限

该研究为后编解码时代的可扩展智能流媒体技术奠定了基础。GenStream不仅解决了带宽效率问题,还为体积化头像合成、跨视角的规范3D演员融合以及个性化观看体验开辟了新方向。这意味着未来用户可能不再受限于固定机位的视频流,而是能够获得更具交互性的媒体体验。不过,目前该技术仍需应对客户端算力要求高以及模型泛化难度大等现实问题,距离大规模商用部署尚有距离。

为什么值得看

突破传统视频编码效率瓶颈,以生成式AI实现极低带宽传输。

论文

信源1

  1. [1]arXiv cs.AI一手信源GenStream: Semantic Streaming Framework for Generative Reconstruction of Human-centric Media

关键事实

  • GenStream用骨骼关键点、相机参数和3D背景模型替代像素传输。[1]

  • 相比HEVC标准,该方案实现了超过99.9%的带宽缩减。[1]

  • 研究已在奥运会花样滑冰影像上完成部分验证。[1]

  • 论文发表于ACM MM 2025。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。