T-Router实现高效推理强化学习,0.46%参数量超越全参微调
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
T-Router通过可寻址块变化库与深度循环控制器,学习对已完成计算的复用与路由,实现参数高效的推理强化学习。在8.95B参数底座上,该接口仅分配41.73M参数(占底座0.466%),经GSM8K RL训练后取得83.64的MathAvg,高于全参GRPO的73.79。同等参数预算下,其MathAvg达83.64,优于LoRA的77.28,且将AIME平均准确率从48.33提至60.56。训练过程冻结底座参数与层级顺序,并可扩展至工具介导推理。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载计算复用与路由机制
T-Router受丘脑路由启发,将模型适配集中于对已完成计算的复用。其核心包含一个压缩的可寻址库用于保存块变化,以及一个深度循环控制器用于调节这些块的选择与相对缩放回写。这种耦合使得上下文依赖的路由具有具体的计算形式:学习接收层使用哪些早期贡献及其影响权重。训练过程采用正确性奖励,且完全保持底座模型的参数与层级顺序不变。
核心性能对比数据
在8.95B参数规模的底座模型上,T-Router仅分配41.73M参数(占比0.466%)。经过GSM8K强化学习后,其MathAvg达到83.64±1.16,显著高于全参数GRPO的73.79±1.83。在可比参数预算与重试次数下,T-Router的83.64±1.16 MathAvg优于LoRA的77.28±1.95,在三个任务族上均有提升,并将AIME平均准确率从48.33提高至60.56。
扩展能力与消融验证
容量控制的对比实验证实了可寻址块变化与循环上下文的优势。此外,通过分离搜索训练,该接口能够扩展至工具介导的推理场景。这些结果确立了受控计算复用作为参数高效推理强化学习有效途径的地位。
为什么值得看
仅用不到0.5%可训练参数即在数学推理上超越全参数强化学习,为低成本提升大模型推理能力提供新路径。
微调强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
