AI Night-Scientist框架用强化学习提升LLM科研创意
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
LLM的低熵偏好导致其开放性科研构思同质化。AI Night-Scientist框架基于认知科学,沿行动、过程与结果三轴对创造力建模,用GRPO算法训练模型何时及如何偏离可预测推理。相比基线模型,该框架使研究方向多样性扩大27.8%,贡献类型扩大14.9%,预估引用影响力提升最高32.0个百分点,原创性提升66.2点。单纯提高解码温度无法复现这些增益,语义引导对指定创造力方向至关重要,表明创造力是可学习的多层能力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载低熵偏好与Night Science
大语言模型在结构化与可验证任务上表现优异,但其固有的低熵偏好易生成同质且可预测的输出,这限制了其在开放性科研构思中的效用。有效的科学发现涵盖更广的创造谱系:从结构化的日科学到松散结构、依赖偶然性的夜科学,后者能触及常规之外的思路。该研究旨在解决LLM在夜科学维度的不足,使其突破常规推理边界。
三轴创造力建模与GRPO训练
研究提出AI Night-Scientist智能体框架,基于认知科学将创造力沿三个轴建模:行动轴关注做什么及如何创造性地做,过程轴决定何时探索与何时利用,结果轴衡量生成思路的新颖性与实用性。框架采用GRPO强化学习算法,在训练中让模型接触不同程度与形式的创造力,从而学习何时及如何偏离可预测推理路径。
量化增益与语义引导关键性
该框架生成了更多样化的科研提案。与基线模型相比,研究方向范围扩大27.8%,贡献类型扩大14.9%。预估引用影响力提升最高达32.0个百分点,原创性提升66.2点。研究强调,单纯提高解码温度无法复现这些增益,关键在于提供语义引导以明确应追求何种创造力,证明创造力是可学习的多层能力,能被塑造以助研究者触及LLM通常无法探索的思路。
为什么值得看
突破LLM低熵同质化局限,用RL让模型学会非预测性推理,大幅提升科研构思多样性与原创性。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
