RiLM 利用测地线解码移除输出层
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
RiLM 框架通过在黎曼流形上展开上下文轨迹,利用测地线距离计算 token 概率,完全移除了占用大量参数的输出矩阵。在 WikiText-2 测试中,参数量约 29 万的 HypRiLM 验证困惑度为 54.2,性能优于 LSTM、Transformer 及 SSM 等基线模型,且在更大词表和不同语料库中表现出迁移能力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载移除输出层架构
传统小型语言模型在嵌入宽度较小时,仍有约三分之一参数用于输出矩阵。RiLM 提出了一种新框架,不再依赖该输出层。它将上下文视为黎曼流形上的轨迹,下一个 token 的概率由当前状态与词向量嵌入之间的测地线距离平方得出。这种设计使得同一嵌入映射同时服务于输入和输出,将解码过程转化为几何计算。
实验性能表现
研究在 WikiText-2 数据集上对比了不同模型。基于庞加莱球的 HypRiLM 模型验证困惑度达到 54.2,而基于平坦空间的 Flat RiLM 为 87.6。作为对比,参数量相当的 LSTM、Transformer 以及 SSM 等循环基线模型困惑度在 113 至 147 之间。HypRiLM 相比表现最好的循环基线 SSM 提升了约两倍。
稳定性与迁移性
该框架在 Penn Treebank 数据集以及 1 万词表的压力测试中验证了其跨语料库和词表规模的迁移能力。研究还指出,双曲曲率在特定情况下有帮助,并分析了朴素双曲递归中的边界坍塌问题,通过 Mobius 稳定化技术恢复了可训练性。所有结论均基于受控的小模型比较。
为什么值得看
为边缘部署的小参数模型提供了新架构,显著降低参数量并提升性能。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
