提出任务与构造器协同进化框架,提升推理数据合成难度

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对现有推理数据合成仅复用生成问题而构造器不变的问题,提出了任务与构造器协同进化(RSI)框架。该框架包含在线与后任务两种自改进调度:在线时将求解器失败转化为可复用技能;后任务时在成本受限下仅采纳能生成更难有效任务的修订。在数学、编程和科学领域,经十四轮进化,求解器平均准确率从100.0%降至54.8%。用1万条合成数学数据微调的27B模型在APEX上达62.5%准确率,媲美前沿模型。合成数据也提升了下游SFT与GRPO表现。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

构造器与任务协同进化

为生成难度递增的推理问题,现有任务级递归仅将已生成问题作为种子,而数据构造器保持不变。该研究提出任务与构造器协同进化框架,引入递归式构造器自改进机制。在线自改进将求解器生成过程中的中间失败转化为可复用技能;后任务自改进在每个批次后修订技能、提示和工作流,仅当修订能在有界成本增加内生成更难的有效任务时才予以采纳。在此过程中,模型权重与验证标准保持固定。

难度进化与下游训练收益

在数学、编程和科学领域的实验中,经过十四轮进化,求解器的平均准确率从100.0%下降至54.8%,证明合成任务难度显著提升。消融实验表明,结合在线与后任务两种更新调度,比固定构造器递归或单独使用任一调度能产生更难的任务。此外,合成数据对下游训练具有实际价值,能提升SFT与GRPO的性能表现。

27B模型微调实验表现

研究展示了合成数据在具体模型微调中的效果。使用1万条由该框架合成的数学示例,对一个27B参数的学生模型进行微调。该模型在APEX基准测试上取得了62.5%的mean-16准确率,其表现可与特定的前沿模型参考相竞争。这证实了适应构造器与任务同步进化,能够生成具有下游训练价值的极具挑战性的数据。

为什么值得看

通过让数据构造器与任务同步进化,为持续生成高难度、高训练价值的推理数据提供了新范式。

微调

信源1 家

  1. [1]arXiv cs.AI一手信源Recursive Harness Self-Improvement for Frontier Reasoning Data Synthesis

关键事实

  • 提出任务与构造器协同进化(RSI)框架,实现递归式构造器自改进以合成推理数据。[1]

  • 在线自改进将求解器中间失败转化为可复用技能,后任务自改进在成本受限下修订技能与工作流。[1]

  • 经十四轮进化,数学、编程和科学领域的求解器平均准确率从100.0%降至54.8%。[1]

  • 用1万条合成数学数据微调27B模型,在APEX基准上取得62.5%准确率,媲美前沿模型。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。