Sherpa框架让LLM自适应教学,学生成绩平均提升20.5%
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有训练LLM当教师的方法依赖演示或预设教学标准,未扎根于个体学习成效。Sherpa框架通过多轮强化学习解决此问题:实例化具备不同学习偏好的学生原型,训练教师模型通过直接最大化这些学生的学习成效来调整指导策略。经该框架训练的教师模型,使各原型学生表现平均提升20.5个百分点;在MathTutorBench评测中,教学得分从52.5%升至79.2%;人类评估中,79.6%的对比更偏好该训练教师。代码与模型已开源。
为什么值得看
提出基于学习成效的多轮强化学习框架,使LLM能自适应不同学生,向真实AI导师迈进一步。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
