CodeMidas仅凭源码构建RL环境,MiMo-V2.5多基准提升超11%
论文AI 评分 82/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
为扩充智能体编码RL训练任务,CodeMidas仅将源码作输入,经探索、构建测试及验证过滤,把已有代码库功能转为可执行环境。由此产出涵盖23种语言与15个领域的5545个任务。基于此用GRPO训练MiMo-V2.5,在五项基准上全面进步:DeepSWE升11.7%,ProgramBench升17%,Terminal-Bench v2.1升8.5%。消融实验证实增高质量任务可提性能,轨迹分析指RL训练使智能体更重代码库探索与自检。
为什么值得看
突破依赖提交记录提取任务的局限,证明源码可作规模化构建编码RL环境的基础,显著提升智能体多场景表现。
智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
