Sherpa框架让LLM自适应教学,学生成绩平均提升20.5%

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有训练LLM当教师的方法依赖演示或预设教学标准,未扎根于个体学习成效。Sherpa框架通过多轮强化学习解决此问题:实例化具备不同学习偏好的学生原型,训练教师模型通过直接最大化这些学生的学习成效来调整指导策略。经该框架训练的教师模型,使各原型学生表现平均提升20.5个百分点;在MathTutorBench评测中,教学得分从52.5%升至79.2%;人类评估中,79.6%的对比更偏好该训练教师。代码与模型已开源。

为什么值得看

提出基于学习成效的多轮强化学习框架,使LLM能自适应不同学生,向真实AI导师迈进一步。

强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Sherpa: Teaching LLMs to Teach Adaptively

关键事实

  • Sherpa是一个多轮强化学习框架,通过实例化不同学习偏好的学生原型来训练教师LLM。[1]

  • 经Sherpa训练的教师模型使各原型学生表现平均提升20.5个百分点。[1]

  • 在MathTutorBench评测中,Sherpa将整体教学得分从52.5%提升至79.2%。[1]

  • 人类研究中,79.6%的成对比较更偏好Sherpa训练的教师而非基础模型。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。