NeutronGym发布:首个中子仪器设计评测环境,强化学习使Qwen3-8B…
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载环境机制与评分设计
NeutronGym旨在检验语言模型智能体进行物理推理而非单纯记忆的能力。智能体通过验证工具构建仪器,McStas负责对构建结果进行光线追踪仿真。环境采用阶梯式评分系统,从语法、运行时、结构和科学性四个层级进行判定,全程不依赖LLM裁判。程序化族提供具有固定布局的无限实例,智能体需设定设计参数,并存在保留参数区间。此外,精选子集McStasBench补充了16项源自已发表仪器的任务,并配备记忆探测与沙箱机制。为获取可信结果,研究者排除了四种无模型基线即可解决的任务设计,并公开了发现这些问题的探测方案。
前沿模型表现与强化学习收益
在McStasBench的16项任务中,七个前沿模型最多仅复现其中7项,无一能检索出参考方案或达成改进目标。然而,该环境具备训练功能。利用其奖励进行强化学习,Qwen3-8B在某族隐藏设计目标的保留实例上通过率从11%跃升至77%(第二种随机种子下达69%),反超未训练的Qwen3-32B。该训练配方在另外三个门控族上同样有效。分析表明,若移除阶梯式评分中的部分信用,性能将暴跌60分,凸显了该机制的必要性。
与经典优化器及大模型对比
对比实验显示,在智能体的模拟预算限制下,仅依赖奖励训练的模型,只有在获得闭式物理公式时,才能达到经典优化器的效果(77%对81%,该差距在当前规模下不显著)。相比之下,前沿模型在同等条件下的解决率高达98-99%。这表明尽管强化学习能显著提升小模型的物理设计能力并跨越参数量级壁垒,但在未提供显式物理公式时,其上限仍与前沿大模型存在明显差距,而前沿模型展现出极强的物理推理或隐式利用知识的能力。
为什么值得看
首个用无LLM裁判的物理仿真环境检验智能体推理而非记忆,且证明RL能让8B小模型反超32B大模型。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
