研究提出用引用影响对齐LLM科研构想生成
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
当前LLM科研构想系统多依新颖性等即时指标训练,未利用延迟的学术影响力信号。本研究基于超10万篇计算机论文构建数据集,提取目标条件构想并赋予年份归一化引用标签。训练奖励模型预测构想影响,通过SFT加RL对齐构想生成器。评估采用留出参考协议,在同目标下对比历史构想并按其引用标签加权。实验表明RL微调模型生成构想的预估影响持续高于基线及SFT基线,证实引用影响可作为对齐LLM开放科学发现的实用反馈信号。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载研究背景与核心问题
当前基于大语言模型的科研构想系统,通常依赖新颖性、清晰度与可行性等可即时评判的代理指标进行训练和评估。这种方式忽略了科学采纳的延迟信号,无法确定能否利用此类信号引导模型走向具有更高预期影响的研究方向。本研究探索将引用归一化影响作为学术采纳的代理指标,尽管存在噪声,但具备可扩展性,以此作为对齐模型的核心反馈信号。
数据集构建与奖励模型训练
研究从超过10万篇计算机科学论文中提取大规模数据集,抽取出目标条件的构想描述,并为每篇论文分配序数的年份归一化引用标签。基于此,训练一个目标条件的奖励模型,用于从研究目标与构想配对中预测引用影响标签。随后,利用该奖励信号对齐构想生成器,具体流程包括先进行监督微调,再进行强化学习。
评估机制与实验结论
为降低评估的循环性,研究采用留出的、基于参考的协议。该协议在相同研究目标下,将模型输出与历史构想对比,并依据参考构想的引用影响标签对判断结果加权。实验结果显示,经过强化学习微调的模型,其生成构想的预估影响持续高于基础模型与仅做监督微调的基线。这表明科学影响能作为实用且基于结果的反馈信号,用于在开放科学发现中对齐大语言模型。
为什么值得看
将引用影响作为反馈信号引入RL对齐,为LLM生成高影响力科研构想提供了区别于新颖性等即时指标的实用新路径。
微调对齐论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
