学者提出ScholarCatalyst基准,评估检索启发新研究论文能力
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
为探究AI寻找启发新研究先验想法的能力,研究团队构建了ScholarCatalyst基准。该数据集通过自动化流程让207篇近期CS论文的184位一作标注了推动其项目进展的候选文献及理由。任务设定为仅依据项目启动时的文献库,检索出这些启发论文。实验显示,智能体搜索的Recall@20为0.42,不及嵌入检索的0.48;基于Claude Fable 5.1的智能体即便可能见过完稿论文,R@20也仅达0.51。结果表明当前模型亟需新训练方法以获取专家级检索直觉。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准构建与任务设定
为研究AI系统从海量文献中感知新问题所需先验想法的能力,研究团队开发了ScholarCatalyst基准。利用自动化流程实现作者标注的规模化,团队邀请207篇近期计算机科学论文的184位第一作者,标记了哪些候选文献确实推动或可能推动其项目进展,并附带详细理由。该基准定义了一项检索任务:给定初始研究问题,要求系统仅从项目启动时已有的文献库中,检索出这些被作者认定的启发式论文。
模型表现与实验对比
实验对比了不同检索方案的表现。调用嵌入检索器作为工具的智能体搜索,其Recall@20为0.42,反而低于直接使用嵌入检索的0.48。即便使用可能已在训练中见过完稿论文的Claude Fable 5.1构建智能体,其R@20也仅提升至0.51。这些数据表明,现有智能体在处理宽泛语料库的科学检索时,缺乏人类专家的直觉,表现甚至不如基础检索方法。
研究愿景与改进方向
上述结果凸显了当前模型在科研灵感检索上的局限性,表明亟需新的训练配方来赋予模型专家级的搜索直觉。研究团队期望ScholarCatalyst能成为迈向科学智能体的一步,使未来的AI系统能够基于半成型的想法,精准指向其所需的先验研究,从而辅助科学家更高效地开展创新工作。
为什么值得看
揭示当前AI智能体在科研灵感检索上不及传统嵌入检索,指明提升模型专家直觉的训练方向。
Claude智能体论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
