论文提出基于损失条件的世界模型状态执行方法
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究提出一种与模型无关的损失条件状态执行方法,用于决定是否执行世界模型的可行提议或保持当前状态。该方法将状态可移动性形式化为存在能降低损失的可行修正,并在独立校准单元上评估提议相对于保持状态的分组有界损失增益。仅在同时下置信界为正的分组中执行提议。在 M4 月度数据集实验中,该方法对 14.0% 的序列执行提议,有界损失为 0.588,优于保持状态的 0.599 和始终执行的 0.621。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载方法核心逻辑
该研究提出了一种名为“损失条件状态执行”的方法,旨在解决世界模型何时应更新状态的问题。作者指出,仅凭预测的信息量不足以确定更新是否会降低下游损失。因此,该方法将状态的可移动性定义为存在能够降低损失的可行修正,并将其与特定提议的收益区分开来。该方法从预测分布中构建特定于损失的可行提议,并在独立的校准单元上评估其相对于保持状态的分组有界损失增益。只有当分组的同时下置信界为正时,才会执行该提议。
实验验证结果
在公共预测和动作条件动力学基准上的实验表明,该方法支持更新,并在认证和覆盖率之间进行了权衡。具体在包含 28,684 个保留序列的 M4 月度数据集上,该方法仅对 14.0% 的序列执行了提议,却实现了 0.588 的有界损失。相比之下,保持当前状态的有界损失为 0.599,而始终执行提议的有界损失为 0.621。对于这两组比较,配对的 95% 自助区间均低于零,证明了该方法的有效性。
电商场景应用
研究还在中国领先电商零售商京东的六种不健康库存类型的受限预测中进行了实验。结果显示,强出现排序信号与基于损失的保持状态偏好共存。这一发现有力地说明了为什么事件的可预测性和状态执行必须分开评估,进一步验证了该方法在复杂实际场景中的适用性和必要性。
为什么值得看
解决了预测信息量与降低损失不匹配的问题,提升世界模型决策的可靠性。
论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
