研究揭示前沿模型在分子基准测试中存在逐字检索现象
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
一项针对 22 个前沿语言模型在 12 个分子回归基准测试中的审计发现,模型普遍存在逐字检索已发布数值的现象。在 5 个数据集中,超过 50% 的模型表现出逐字检索行为,而在其余数据集中仅零星出现。实验表明,推理层级会改变检索行为,高推理层级下的检索标记比最低层级多 89%。抑制检索后,不同模型的预测误差在相对值上更为接近,说明模型的通用预测能力并不完全取决于记忆数值的多少。
为什么值得看
揭示了模型在科学计算基准测试中可能通过记忆而非推理获得高分,影响评估真实性。
基准测试数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
