MatLoom提出紧凑分层语言实现文本生成可编辑材质

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

MatLoom是一种面向文本生成材质的紧凑分层语言,通过预训练语言模型生成由alpha遮罩层组成的程序。程序中共享空间表达式显式定义了覆盖范围与PBR通道,使图案、颜色和浮雕的依赖关系清晰。独立解释器将程序评估为材质贴图,同时源码保留命名字段与层参数供后续编辑。无需微调,管线通过解析器引导修复与预览批评修正设计,并搜索噪声种子。在141个提示的基准测试中,其最佳配置在四项对齐指标上优于三个扩散基线,初始程序平均BLIPScore即超基线。30人参与的盲测中,其渲染获59.2%选择,最高基线仅19.3%。生成程序跨主干网中位长度21行。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

分层语言与程序设计

MatLoom的核心是一种紧凑且面向分层的语言,专为配合预训练语言模型进行文本到材质的生成而设计。生成的每个程序由多个带有alpha遮罩的层组合而成,这些层通过共享的空间表达式来定义覆盖范围以及基于物理的渲染(PBR)通道。这种设计使得图案、颜色和浮雕之间的依赖关系变得显式且清晰。独立的解释器负责将这些程序评估转化为最终的材质贴图,而源码本身则保留了命名字段和层参数,从而支持生成后的后续编辑与调整。

无需微调的生成管线

该方案无需针对特定任务进行微调。其生成管线采用了解析器引导的修复机制以及基于预览的批评机制来迭代修正材质设计。在修正完成后,管线会在保持每个候选程序其余源码固定不变的前提下,对噪声种子进行搜索以优化结果。在包含141个提示词的基准测试中,结合六种主干网络评估,其最佳性能配置在四项平面布局提示对齐指标上的平均得分均高于三个扩散基线。甚至在应用批评或种子搜索之前,其生成的初始程序在平均BLIPScore上就已经超越了所有三个基线。

人类评估与程序紧凑性

在人类偏好评估中,30名参与者在20个提示词下进行了四路盲测比较。MatLoom的渲染结果获得了59.2%的选择比例,而最受偏好的扩散基线仅获得19.3%的选择。此外,从实用性角度看,跨不同主干网络汇总的保留程序中位长度仅为21行。这表明紧凑的可执行程序不仅能够生成与提示高度对齐的材质,还能将材质的构造规则作为资产的一部分保留下来,兼顾了生成质量与可编辑性。

为什么值得看

生成可执行且极短的源码而非仅图像,让材质具备可解释的构造规则与编辑能力,对齐度远超扩散模型。

微调对齐基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源MatLoom: Layered Text-to-Material Generation in a Compact Program Space

关键事实

  • MatLoom使用紧凑分层语言生成材质,程序中位长度仅21行,保留源码供后续编辑。[1]

  • 无需微调,通过解析器引导修复与预览批评修正设计,并在固定源码下搜索噪声种子。[1]

  • 在141个提示基准中,最佳配置四项对齐指标均优于三个扩散基线,初始程序BLIPScore即超基线。[1]

  • 30人盲测20个提示,MatLoom渲染获59.2%选择,最受偏好基线仅19.3%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。