AI 圈大事记

CodeMidas仅凭源码构建RL环境,MiMo-V2.5多基准提升超11%

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

为扩充智能体编码RL训练任务,CodeMidas仅将源码作输入,经探索、构建测试及验证过滤,把已有代码库功能转为可执行环境。由此产出涵盖23种语言与15个领域的5545个任务。基于此用GRPO训练MiMo-V2.5,在五项基准上全面进步:DeepSWE升11.7%,ProgramBench升17%,Terminal-Bench v2.1升8.5%。消融实验证实增高质量任务可提性能,轨迹分析指RL训练使智能体更重代码库探索与自检。

为什么值得看

突破依赖提交记录提取任务的局限,证明源码可作规模化构建编码RL环境的基础,显著提升智能体多场景表现。

智能体

信源1

  1. [1]arXiv cs.AI一手信源CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

关键事实

  • CodeMidas仅用源码作输入,将代码库已实现功能转为可执行RL环境[1]

  • 产出5545个训练任务,源自3185个代码库,跨23种语言与15个技术领域[1]

  • 用GRPO训练MiMo-V2.5,DeepSWE提升11.7%,ProgramBench提升17%,Terminal-Bench v2.1提升8.5%[1]

  • 轨迹分析表明RL训练后的智能体增加了代码库探索并展现更多样自验证[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。