FLEET方法为LLM引入记忆机制,同等算力下实现3倍加速
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型温度采样因无记忆导致重复生成、收益递减的问题,FLEET方法将生成过程表示为越过熵阈值的稀疏轨迹,据此推断逐token效用分并调整logits。评测显示,达到基线同等精度时提速3倍;同等预算下,LiveCodeBench Pass@32从59.9%升至66.2%。该法在贪心解码下具确定性,单次校准推导超参,对现有管线改动极小。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载采样重复困境与记忆机制
依赖大模型温度采样的方案常聚合多次采样结果以提升准确与稳定性。但该无记忆做法无法感知先前生成及评估,随采样增多产生大量语义重复答案,致使收益递减。FLEET通过在生成中集成记忆机制应对此局限,把每次生成表示为一条稀疏轨迹,该轨迹仅穿过熵超预设阈值的状况,借此推断各token效用分,进而调整logits分布。
加速与精度提升表现
基准评测表明,FLEET在达成与重复采样基线同等准确度时,能获取3倍速度提升。在同等计算预算下,它大幅提升了复杂编程任务的准确率,具体在LiveCodeBench评测里,Pass@32指标从59.9%跃升至66.2%。这表明该方法在避免无效重复采样的同时,有效利用了算力预算探索更有价值的解答空间。
易用性与管线集成
在所评估的贪心解码配置中,FLEET方法是确定性的。它仅需单次校准过程即可推导出核心超参数,且对现有大模型管线的修改要求极低。这种低侵入性设计使得开发者在引入该轨迹推断与logits调整机制时,无需对底层架构进行大规模重构,降低了先进解码策略的落地门槛。
为什么值得看
解决重复采样效率瓶颈,在复杂代码任务上显著提效且极易接入现有管线。
大模型算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
