研究揭示4D LiDAR语言模型时空推理缺陷并发布新基准
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对4D LiDAR语言模型的时空推理能力,研究提出LiDAR-Hallu基准及诊断协议,含1万问题与150个nuScenes场景。测试发现,两B4DL配置模型在正侧向运动案例上全部失败,且对需相反答案的成对场景常给出相同回复,恒选同选项即可接近其多项选择准确率。时序打乱对比解码未能带来净提升。代码与数据已公开。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载新基准与诊断协议
为检验4D LiDAR语言模型对物体及演变空间关系的推理能力,研究团队构建了LiDAR-Hallu基准。该基准包含1万个问题,横跨150个nuScenes场景,考察目标存在性、自车相对位置、距离排序、相对运动与时序定位。协议设定了明确的对象选择、时间比较与参考答案确定规则,并融合固定答案与候选内容控制、具有相同提示但参考答案相反的跨场景配对,以及特定关系召回率。
模型时空推理缺陷
对10万条回复的分析揭示了被整体准确率掩盖的失败。仅凭候选时长即可在不观测LiDAR数据时预测时序答案。在成对问题上,模型常对需相反答案的场景给出相同回复。特定关系分析表明,两种B4DL衍生配置在所有测试条件下均遗漏了全部正侧向运动案例。此外,恒选同一选项的准确率几乎与这两种配置的多项选择准确率持平。
解码策略效果与启示
研究测试了时序打乱对比解码策略,发现其几乎未产生净改进,因修复量基本被新增错误抵消,主要失败依然存在。这表明评估时空推理需测试模型能否区分被查询的物理关系,而非仅依赖单项准确率。相关源码、检查点与数据已公开发布。
为什么值得看
揭露当前LiDAR语言模型在物理时空关系理解上的严重缺陷,提供针对性诊断基准与协议。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
