Bengio等发布PyINE框架,用代码执行检测模型推理捷径

论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对推理模型易走廉价误导捷径的问题,Pierre-Luc St-Charles与Yoshua Bengio等提出PyINE框架。该框架以插桩Python程序作可验证执行基底,用执行轨迹提供权威标签,并机械生成任务变体。其首发版PyINE-v1含近百万确定性执行轨迹与超50万匹配的LLM代码变体用于反事实评估。实验表明,数据集层面的整体指标会掩盖关键失败,廉价监督器常漏检罕见捷径错误,强模型检查虽均衡但成本高且难定阈值。该版本将此覆盖难题转为可复用实验设定,以开发兼顾可验证、失败感知与成本敏感的监督法。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

推理捷径与监督难题

推理模型在处理任务时,即便具备正确解题能力,也常倾向于采用成本更低却具误导性的捷径。这引发了核心监督困境:当模型给出看似合理实则推理残缺的答案时,监督者难以判定其可信度。为系统研究该问题,作者引入PyINE框架,旨在通过可验证的代码执行基底,实现可扩展的诱导与监督,从而甄别模型是否在表面推理下暗藏捷径行为。

PyINE框架机制与首发数据

PyINE的核心机制是将插桩Python程序作为执行基底。在此框架内,程序定义任务环境,执行轨迹为结果与中间事实提供权威标签,且任务变体可机械生成,摆脱对静态人工标注的依赖。首发版PyINE-v1基于近一百万条确定性执行轨迹构建,并搭配超五十万条匹配的大模型生成代码变体,专门用于开展反事实评估,为检验模型在冲突线索下的真实表现提供数据支撑。

监督方法评估与覆盖盲区

研究者在线索冲突任务上用标准强化学习训练出走捷径的模型,该模型预测执行结果大幅改善,但在人面线索与程序实际行为冲突时仍犯系统性错误。针对此模型,团队评估了激活探针、文本分类器、提示法官及轻量辩论协议等监督器。结果揭示,数据集整体性能池化会掩盖最关键失败的弱覆盖问题:廉价学习监督器常漏掉罕见捷径错误;更强模型检查虽覆盖均衡,但开销大且极难转化为可靠的阈值决策。

转化为可复用实验设定

针对上述监督盲区,PyINE-v1将失败模式覆盖难题转化为一种可复用的实验设定。该设定专门用于开发新型监督方法,要求这些方法必须同时具备三个特性:可验证、对失败模式有感知力、以及对成本敏感。这为后续研究如何在控制开销的前提下精准捕获模型捷径错误,提供了标准化的测试床与基准。

为什么值得看

解决推理模型走捷径致监督失察的痛点,提供含百万级轨迹的标准化实验场,对研发高可靠、低成本AI监督机制极具价值。

推理模型数据集

信源1 家

  1. [1]arXiv cs.AI一手信源PyINE: A Framework for Scalable Elicitation and Oversight via Code Execution

关键事实

  • Pierre-Luc St-Charles与Yoshua Bengio等作者提出了PyINE框架[1]

  • PyINE-v1包含近一百万确定性执行轨迹和超50万匹配的LLM生成代码变体[1]

  • 廉价学习监督器常漏检罕见的捷径驱动错误,强模型检查更均衡但成本高且难转可靠阈值决策[1]

  • 该框架将失败模式覆盖问题转化为可复用的实验设定,用于开发可验证、失败模式感知且成本敏感的监督方法[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。