至知发布IQuest-Q1模型:320B总参15B激活,可排RL训练Bug
论文AI 评分 78/100量子位待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
至知创新研究院推出IQuest-Q1模型,采用decoder-only Transformer与稀疏MoE架构,总参数320B,激活参数15B。该模型能通过单句Prompt生成可玩HTML小游戏,并成功定位修复了RL训练中因推理服务解码额外插入空格导致前缀匹配断裂的Bug,使训练重回正轨。评测方面,其在NL2Repo、CyberGym、Terminal-Bench 2.1等复杂任务中表现不俗。模型还参与了自身研发迭代,验证通过的更新直接流入下轮版本。团队近期还提出了MuonH优化、稀疏权重分解,并参与提出ModularRSI自进化框架,将Agent在Terminal-Bench 2.0准确率从47.57%提至52.43%。
为什么值得看
MoE模型不仅能写代码,还能实战排查RL训练底层Bug并自迭代,对复杂工程排错极具参考价值。
MoE
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
