研究提出HC-DLM,结合连续与离散扩散提升推理能力
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对离散扩散模型并行解码时切断token依赖,以及连续扩散模型去噪时缺乏合法token约束的瓶颈,研究提出分层连续扩散语言模型(HC-DLM)。该模型将离散token生成与连续潜变量轨迹耦合于单一去噪过程,以潜变量作为唯一持久生成状态,每步读取token并作为下次潜变量更新的支架,训练目标由token似然的变分界推导。在同等参数量下,HC-DLM于Sudoku谜题准确率、Countdown规划准确率及LM1B生成困惑度上均优于离散与连续扩散基线。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载扩散语言模型的结构瓶颈
离散扩散语言模型虽能为双向推理与全局约束满足提供替代方案,但在并行解码时,各token独立从边缘分布采样,切断了同时解码token间的统计依赖。连续扩散语言模型虽通过去噪共享连续状态避免了该问题,但其去噪器仅能看到该状态,在最终解码前没有任何机制将其与合法的token配置相联系,缺乏对有效离散结构的约束。
HC-DLM的耦合与生成机制
为解决上述瓶颈,分层连续扩散语言模型(HC-DLM)在单一且原则性的去噪过程中,将离散token生成与连续潜变量轨迹相耦合,其训练目标由token似然的变分界推导得出。与近期将连续上下文附加于独立离散链的方法不同,HC-DLM令潜变量成为唯一的持久生成状态:每一步均从中读取token,并将其作为下一次潜变量更新的支架进行反馈,从而在连续去噪过程中持续维持与合法token配置的联系。
推理与建模实验表现
在结构化推理(Sudoku)、数学规划(Countdown)及语言建模(LM1B)任务上,同等模型规模下,HC-DLM均超越了离散与连续扩散基线。具体而言,在Sudoku与Countdown任务上提升了谜题求解准确率,在LM1B数据集上降低了生成困惑度,验证了该架构在强化逻辑推理与文本生成质量上的有效性。
为什么值得看
解决扩散语言模型并行解码的依赖缺失与约束不足,在逻辑推理与语言建模上显著超越基线。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
