AI 圈大事记

新方法仅优化10万偏置参数实现测试时强化学习

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

研究人员提出一种无标签偏置测试时强化学习方法,在保持预训练主干冻结的情况下,仅优化约10万个偏置参数。该方法利用多数投票伪标签作为奖励信号,在MATH-500数据集上达到76.67%的准确率,略超有标签偏置引导复现结果,且优化参数量比全参数方法少7.6万倍。该训练流程同样提升了视觉语言和音频推理任务的表现,且学习到的引导向量能迁移至4500个未见过的数学问题。

为什么值得看

大幅降低测试时适应的计算成本,无需人工标注即可提升模型推理能力。

强化学习数据集

信源1

  1. [1]arXiv cs.AI一手信源Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

关键事实

  • 仅优化约10万个偏置参数,保持预训练主干冻结。[1]

  • MATH-500准确率达76.67%,参数量比全参数TTRL少7.6万倍。[1]

  • 利用多数投票伪标签作为奖励信号,实现无标签适应。[1]

  • 引导向量可迁移至4500个未见过的MATH问题。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。