AI 圈大事记

研究解构分词器设计要素

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

该研究针对现代语言模型常用的 BPE 和 UnigramLM 分词算法,通过引入 BottomUpLL 和 TopDownComp 两种新算法,解构了优化目标与搜索过程对性能的影响。实验在不同模型规模、词汇量大小及语言领域下进行,结果显示在 bits-per-byte 指标上,搜索过程而非优化目标是主导因素,自底向上的分词器表现更佳;但在 BLiMP 任务中未发现设计选择与性能的稳定关系。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解构分词算法设计

现代语言模型主要采用字节对编码(BPE)和 UnigramLM 两种分词算法。这两种算法在两个正交维度上存在差异:优化目标(压缩率 vs 对数似然)和搜索过程(自底向上合并 vs 自顶向下剪枝)。现有研究往往混淆这两个维度,导致难以区分性能差异究竟是源于优化目标还是搜索过程。为了解决这一问题,研究团队引入了两种新的分词算法:BottomUpLL(基于自底向上似然的分词器)和 TopDownComp(基于自顶向下压缩的分词器),从而补全了 2x2 的设计空间。

实验设置与评估

研究人员利用上述四种算法生成的分词器训练语言模型,并在多种条件下进行对比测试。实验变量包括模型规模、词汇表大小以及应用领域(仅英语或多语言)。评估主要依据 bits-per-byte 指标,该指标常用于衡量语言模型的压缩效率。此外,研究还在 BLiMP(语言极简主义基准)任务上进行了测试,以评估分词器对模型语法能力的影响。

搜索过程影响显著

实验结果显示,在 bits-per-byte 指标上,搜索过程是决定性能的主导因素,而非优化目标。具体而言,采用自底向上搜索策略的分词器在大多数设置下均能实现更低的 bits-per-byte 值,意味着其压缩效率更高。然而,在 BLiMP 任务的评估中,研究并未发现分词器的设计选择与模型性能之间存在一致的关系。这表明分词器设计对模型不同方面能力的影响可能存在差异。

为什么值得看

厘清了分词器设计中目标函数与搜索策略的实际贡献,为构建更优分词器提供了实证依据。

信源1

  1. [1]arXiv cs.AI一手信源Objective vs. Search: Decomposing What Makes a Good Tokeniser

关键事实

  • 引入 BottomUpLL 和 TopDownComp 两种新分词算法以解构设计空间。[1]

  • 实验变量涵盖模型大小、词汇量大小及语言领域。[1]

  • Bits-per-byte 指标显示搜索过程是主导因素,自底向上更优。[1]

  • BLiMP 任务评估显示设计选择与性能无稳定关系。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。