AI 圈大事记

研究揭示前沿模型在分子基准测试中存在逐字检索现象

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

一项针对 22 个前沿语言模型在 12 个分子回归基准测试中的审计发现,模型普遍存在逐字检索已发布数值的现象。在 5 个数据集中,超过 50% 的模型表现出逐字检索行为,而在其余数据集中仅零星出现。实验表明,推理层级会改变检索行为,高推理层级下的检索标记比最低层级多 89%。抑制检索后,不同模型的预测误差在相对值上更为接近,说明模型的通用预测能力并不完全取决于记忆数值的多少。

为什么值得看

揭示了模型在科学计算基准测试中可能通过记忆而非推理获得高分,影响评估真实性。

基准测试数据集

信源1

  1. [1]arXiv cs.AI一手信源Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

关键事实

  • 审计了 22 个前沿模型在 12 个回归基准上的逐字检索情况。[1]

  • 在 5 个数据集中,超过 50% 的模型显示逐字检索。[1]

  • 高推理层级比最低推理层级的检索标记多 89%。[1]

  • 抑制检索使不同模型的预测误差在相对上更接近。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。