LP-BTS架构解决大规模动态动作空间规划
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载动态动作空间挑战
许多学习型序列决策系统直接将当前状态映射为动作,但在候选动作数量众多、具有几何结构且随状态重建时,这种直接映射变得脆弱。一对多移动充电场景具体化了这一设定:当传感器数量为 250 个时,初始状态会诱导出约 1125 个候选充电停止动作。每个选定的停止点同时服务其范围内的传感器,且随着传感器耗尽,动作空间会发生变化。
LP-BTS 架构设计
LP-BTS 是一种学习引导的规划架构,旨在应对上述挑战。该架构包含三个核心组件:图提议策略用于集中较小的候选支持集;学习到的价值评估器用于评估叶节点;边缘预算 PUCT 用于在提交动作前比较短期的模拟未来。由于策略对该集合进行评分时无需固定的输出头,因此单个冻结检查点即可覆盖从 736 到 2813 个停止点的所有评估设置。
实验性能表现
匹配消融实验揭示了各组件的互补效应:均匀采样会导致存活率下降 8.8 个百分点;而在固定目标支持的情况下,PUCT 联合保留了 1.4 个百分点(约 250 个传感器中的 3.5 个),且直接策略选择多移动了 23% 的距离。在预先指定、密封的 30 个场景确认库中,LP-BTS 取得了观察到的最高存活率(0.4545)和存活 AUC(0.8031)。
与基线方法对比
LP-BTS 相比最强的领域工程比较器,其估计的存活率优势为 +0.0066(95% 置信区间 [-0.0037, +0.0184]),这一差异尚未解决。同时,该方法在所有配对场景中均优于截止时间启发式算法和两种源衍生的直接策略重建方法。这两个学习行是基于 Gong 等人报告的变体进行训练和重建的。该结果为在大规模动态动作空间中进行学习引导规划提供了受控证据。
为什么值得看
针对动态且几何结构化的复杂动作空间,提供了学习引导规划的有效实证。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
