论文提出Brain-SAD框架,引入动态恐惧约束提升自动驾驶安全性
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对现有受限强化学习在自动驾驶中因静态约束难以适应多交互场景的问题,Brain-SAD框架引入动态恐惧约束。该框架感知车流交互生成恐惧信号,在线决定常规交互的长效策略或紧急防撞的短效策略。这两种策略分别构建为与动作影响直接耦合的整体恐惧代价,以及由风险邻居推导的动态可行域恐惧边界,用于在线策略优化。实验表明,该方法成功率更高,任务完成与碰撞恢复耗时更短,在复杂连续路口可靠性更强。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载现有受限强化学习的局限
受限强化学习在自动驾驶安全控制中,通常通过约束动作来限制整体风险以最大化期望奖励。然而,现有方法的约束缺乏动态性。软约束方法中的动作代价常被定义为静态的状态到代价映射,硬约束方法的安全动作投影则依赖离线演示估计出的固定可行域边界。这种缺陷使施加的约束与训练场景紧密耦合,导致策略在面对不同交互场景时,因不当的状态级动作代价和静态投影边界而难以有效应对。
动态恐惧约束与双策略机制
Brain-SAD框架受大脑启发,通过感知当前车辆交互场景生成动态恐惧信号作为恐惧反应。基于此反应,框架在线决定采用何种策略:常规交互采用长效策略,紧急防撞采用短效策略。在这两种策略中,恐惧反应被构建为动态恐惧约束。具体而言,一是在长效策略中反映与动作影响直接耦合的整体恐惧代价,二是在短效策略中形成由不同风险邻居推导的动态可行域恐惧边界。这两者共同服务于在线策略优化。
实验效果与性能提升
实验结果表明,相较于现有方法,Brain-SAD实现了更高的成功率,同时缩短了任务完成时间和碰撞恢复时间。此外,在复杂度波动的连续路口场景中,该框架展现出了更强的可靠性,验证了动态恐惧约束机制在提升自动驾驶策略适应性与安全性方面的有效性。
为什么值得看
突破自动驾驶受限强化学习的静态约束局限,用动态恐惧机制提升复杂交互场景下的安全性与可靠性。
强化学习安全论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
