AI 圈大事记

亚马逊团队发布Rufus-Air开源大模型后训练方案

论文AI 评分 82/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

亚马逊前员工发布针对GLM-4.5-Air-Base(106B-A12B)的开源可复现后训练方案Rufus-Air。该方案包含SFT、推理RL、编码RL、指令遵循RL、通用/编码/搜索Agent及RLHF共八阶段串行流水线,从基础能力向高级能力推进,奖励信号由硬性可验证向软性评判过渡。全程基于开源组件与公开数据,无需新人工标注或内部蒸馏教师。其表现超越官方GLM-4.5-Air后训练版本,与同规模开源模型具竞争力。核心发现:高质量多样SFT奠定能力底座,难度过滤维持RL有效学习区间,奖励可靠性决定阶段排序,基础设施与工程选择是方案核心而非单纯实现细节。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

八阶段串行训练流水线

Rufus-Air将大模型后训练组织为八个串行阶段:监督微调(SFT)、推理强化学习、编码强化学习、指令遵循强化学习、通用Agent、编码Agent、搜索Agent以及基于人类反馈的强化学习(RLHF)。阶段推进遵循从基础到高级能力的演进逻辑,奖励信号设计则从硬性可验证奖励逐步过渡到基于软性评判模型的信号,确保模型能力阶梯式稳固提升。

全开源与零额外标注

该方案的核心优势在于完全基于开源组件与公开数据构建,大量数据直接采用原始发布版本,无需额外的人工数据标注,也不依赖内部的蒸馏教师模型。这大幅降低了后训练复现的门槛与成本,使得整个106B-A12B架构模型的后训练过程具备高度透明性与可操作性。

四项核心训练发现

研究总结了四项关键发现:第一,多样且高质量的SFT数据为模型建立了坚实的能力底座;第二,难度过滤机制能将RL提示保持在高效的学习区间内;第三,奖励可靠性为各阶段排序提供了实用原则;第四,基础设施与工程选择本身就是训练配方的重要组成部分,而非单纯的底层实现细节。这些发现为后续开源模型的后训练提供了明确的工程与数据指导。

性能对比与竞争力

在最终性能表现上,Rufus-Air超越了GLM-4.5-Air的官方后训练发布版本,并且在同等参数规模的开源模型中展现出相当的竞争力。该工作由蔡源长等21位作者在亚马逊任职期间共同完成,以长文形式详细记录了数据、奖励设计、基础设施、阶段顺序及各阶段结果,供社区完整复现。

为什么值得看

提供完整八阶段开源后训练配方,无需额外标注即超越官方基线,对复现与优化大模型对齐极具实操参考价值。

大模型蒸馏开源模型

信源1 家

  1. [1]arXiv cs.AI一手信源Rufus-Air: An Open LLM Post-Training Recipe

关键事实

  • Rufus-Air是基于GLM-4.5-Air-Base(106B-A12B)的开源可复现后训练方案[1]

  • 方案包含SFT、推理RL、编码RL、指令遵循RL、通用Agent、编码Agent、搜索Agent和RLHF八个阶段[1]

  • 训练全程使用开源组件与公开数据,无需新人工标注或内部蒸馏教师[1]

  • Rufus-Air表现超越官方GLM-4.5-Air后训练版本,与同规模开源模型竞争力相当[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。