AI 圈大事记

研究称LLM候选选项增多时准确率显著下降,提出缓解方案

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

该研究发现,大语言模型在多选评估中,随候选选项数量增加,准确率在各任务、提示策略及模型规模下均大幅下降。长上下文检索无法完全解释此退化。研究识别出两种失败模式:正确答案与最强干扰项的分数差距逐渐缩小(主要由对正确答案的置信度减弱驱动);早期候选偏好难以被推翻,后期候选影响渐弱。采用层级分区与基于排列的推理方法,在N=160的HotpotQA与MIMIC任务上,将准确率提升约20个百分点。结论表明小规模候选集的优异表现不代表大规模比较同样稳健。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

选项规模扩大致性能退化

当前广泛采用的多选与候选选择评估来衡量大语言模型的推理及决策能力,但现有基准通常包含的候选集较小。该研究系统评估了候选竞争者数量增加时模型的表现,发现在各类任务、提示策略和模型规模下,准确率均出现大幅下降。受控分析表明,标准的长上下文检索解释无法完全涵盖这种性能退化现象,说明问题根源不仅在于信息检索困难。

两种系统性失败模式

研究明确了导致退化的两种系统性失败模式。首先是金标准边缘坍塌,即正确答案与最强干扰项之间的分数差距逐渐缩小,这主要由对正确答案的置信度减弱所驱动。其次是早期候选偏好固化,随着选项增多,模型越来越难以推翻对早期出现的候选者的偏好,后期出现的候选者对最终预测的影响逐渐变弱。

缓解方法与评估启示

基于上述发现,研究评估了层级分区和基于排列的推理方法。在HotpotQA和MIMIC任务中,当候选数量N达到160时,这两种方法将准确率提升了约20个百分点。总体结论指出,候选集规模是评估协议中的重要变量,在少量选项上表现强劲并不能保证在进行大规模候选比较时同样具备稳健性。该工作已被NeurIPS 2026的Trust-AI-Eval研讨会接收。

为什么值得看

揭示LLM在大量选项下决策能力退化的机制及缓解方法,对设计大规模评估基准具有重要参考价值。

论文

信源1 家

  1. [1]arXiv cs.AI一手信源Overwhelmed by Choice: Studying LLM Decision Making at Scale

关键事实

  • 大语言模型随候选选项数量增加,准确率出现显著下降[1]

  • 准确率退化由正确答案置信度减弱及早期候选偏好难以推翻导致[1]

  • 层级分区与排列推理在N=160时将HotpotQA和MIMIC准确率提升约20个百分点[1]

  • 该论文被NeurIPS 2026的Trust-AI-Eval研讨会接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。