AI 圈大事记

至知发布IQuest-Q1模型:320B总参15B激活,可排RL训练Bug

论文AI 评分 78/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

至知创新研究院推出IQuest-Q1模型,采用decoder-only Transformer与稀疏MoE架构,总参数320B,激活参数15B。该模型能通过单句Prompt生成可玩HTML小游戏,并成功定位修复了RL训练中因推理服务解码额外插入空格导致前缀匹配断裂的Bug,使训练重回正轨。评测方面,其在NL2Repo、CyberGym、Terminal-Bench 2.1等复杂任务中表现不俗。模型还参与了自身研发迭代,验证通过的更新直接流入下轮版本。团队近期还提出了MuonH优化、稀疏权重分解,并参与提出ModularRSI自进化框架,将Agent在Terminal-Bench 2.0准确率从47.57%提至52.43%。

为什么值得看

MoE模型不仅能写代码,还能实战排查RL训练底层Bug并自迭代,对复杂工程排错极具参考价值。

MoE

信源1 家

  1. [1]量子位精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

关键事实

  • IQuest-Q1采用稀疏MoE架构,总参数约320B,激活参数约15B。[1]

  • 模型成功定位并修复了RL训练中因推理服务解码额外插入空格导致前缀匹配断裂的Bug。[1]

  • 模型在NL2Repo、CyberGym、Terminal-Bench 2.1、DeepSWE v1.1、JobBench等评测中表现不俗。[1]

  • ModularRSI自进化框架将Agent在Terminal-Bench 2.0准确率从47.57%提升至52.43%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。