新方法RLCP提升序列推荐多样性,最高达5.21倍

论文AI 评分 62/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对序列推荐固定候选集大小的局限,Wenwen Si等人提出RLCP方法。该方法利用critic分数与在线阈值动态调整保留的动作集,并基于二元反馈更新阈值。理论推导给出了代理缺失率的确定性边界,并将价值损失精确分解为过滤与选择损失,在非收敛参数下也保证了会话奖励边界。在KuaiRand-Pure与MovieLens 1M上的19项测试中,RLCP在保持竞争性会话深度且不增大保留集的前提下,至少一种变体取得最高目录多样性,达最强基线的1.11至5.21倍。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

动态候选集与阈值更新

传统序列推荐系统常采用固定大小的候选集,忽略了单次会话中有效选项数量的动态变化。为解决此问题,作者提出RLCP框架。该框架核心在于依据critic分数与动态在线阈值来裁剪并保留动作集。在线阈值的更新机制依赖于二元反馈信号,该信号指示当前保留集合是否包含属于代理目标的动作。这种机制使系统能根据实时反馈自适应调整候选集规模,而非依赖静态配置。

价值损失分解与理论边界

在理论分析方面,作者首先证明了沿着自适应轨迹观察到的代理缺失率存在确定性边界。为了量化裁剪操作对最终奖励的影响,推导出价值损失的精确分解公式,将其拆分为过滤损失与选择损失两部分。在显式的代理与critic近似条件下,该分解进一步推导出有限的会话奖励边界。此边界同时涵盖了不完美选择与集合截断的影响,且推导过程不要求学习参数必须收敛。

实验表现与多样性提升

实验在KuaiRand-Pure与MovieLens 1M两个数据集上进行,对比了两种RLCP实现与四种强化学习基线方法。在全部19种实验配置中,至少有一种RLCP变体取得了最高的目录多样性指标。其多样性具体表现为最强基线的1.11倍至5.21倍。同时,RLCP在实现多样性大幅提升时,保持了具有竞争力的会话深度,且未导致保留的动作集规模增大,体现了其在效率与多样性间的有效平衡。

为什么值得看

突破固定候选集限制,在保证奖励与效率下大幅提升推荐多样性,对序列推荐系统有直接工程价值。

数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Reinforcement Learning with Conformal Action Sets: An Application to Sequential Recommendation

关键事实

  • 提出RLCP方法,利用critic分数与在线阈值动态调整保留动作集[1]

  • 推导出代理缺失率的确定性边界,并将价值损失分解为过滤与选择损失[1]

  • 在KuaiRand-Pure与MovieLens 1M数据集的19种配置下进行实验[1]

  • RLCP变体取得最高目录多样性,达最强基线的1.11至5.21倍[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。