EVOL框架解决学习路径推荐稀疏奖励难题,已获CIKM2026接收

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对强化学习做学习路径推荐时面临的组合搜索空间超指数增长与真实专家路径缺失双重障碍,EVOL框架引入机器人学中的模拟器示范学习思路。它借助知识追踪模拟器,通过进化搜索为每位学习者合成专属专家示范,再将示范蒸馏至前馈学习器以获取免部署策略。在ASSIST15等三个数据集及不同路径长度下,该框架表现超越八种基线方法,且最终效果取决于进化专家质量而非特定模仿目标。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

LPR强化学习双重困境

使用强化学习进行学习路径推荐时遭遇两大耦合难题。其一,策略需一次性承诺包含L个概念的序列,缺乏中间反馈,致使组合搜索空间随L呈超指数级膨胀,且仅在最终步骤提供奖励。其二,教育数据中天然缺失专家学习路径,因为学生日志仅记录其实际行为,而非理想路径,导致稀疏奖励强化学习缺乏天然解药。

模拟器引导的专家合成与蒸馏

EVOL借鉴机器人学中基于模拟器的示范学习方案来化解上述困境。该框架利用知识追踪模拟器执行两项关键任务:首先通过进化搜索为每个学习者合成专属的专家示范;随后训练一个免部署策略,将这些示范蒸馏至前馈学习器中。在具体实现上,EVOL采用非对称Actor-Critic架构,Actor执行符合部署现实的盲规划,而Critic在训练阶段利用特权模拟器状态。

实验表现与决定性因素

在ASSIST15、Junyi和EdNet三个数据集(概念数从39至189不等)以及5、10、20三种路径长度设定下,EVOL击败了涵盖启发式、序列式、强化学习、图增强强化学习及大模型增强方法在内的8种基线。此外,研究对比了BC、AWR和DAPG三种模仿策略,发现系统的最终性能受控于进化专家的质量,而非特定的模仿目标函数。

为什么值得看

将机器人模拟器示范学习跨界引入教育推荐,解决无真实专家路径与长序列稀疏奖励痛点,效果显著优于现有方案。

强化学习蒸馏论文数据集

信源1 家

  1. [1]arXiv cs.AI一手信源EVOL: Simulator-Guided Evolutionary Expert Synthesis for Deployment-Free Learning Path Recommendation

关键事实

  • EVOL框架利用知识追踪模拟器通过进化搜索合成个性化专家示范,并蒸馏为免部署策略。[1]

  • 该框架在三个数据集(ASSIST15、Junyi、EdNet)及不同路径长度(5、10、20)下超越了8种基线方法。[1]

  • 实验表明最终性能由进化专家质量决定,而非特定的模仿目标(BC、AWR、DAPG)。[1]

  • 该论文已被第35届ACM信息与知识管理国际会议(CIKM 2026)接收。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。