研究提出AgentHabit基准,刻画智能体日常任务行为倾向
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载HABIT分类法构建
当前大语言模型智能体在协助处理日常任务时,即便输出结果可用,其执行过程也未必符合用户偏好。为系统刻画这种执行差异,研究团队自下而上构建了HABIT分类体系。该体系由3名人类作者与3个大语言模型,对横跨17个领域的408条智能体交互轨迹进行归纳分析得出,最终形成包含5大类别、23个行为轴的分类框架。在预留测试任务上,相较于现有人类价值观与智能体动作分类法,HABIT能更清晰地区分不同模型,同时维持相当的标注一致性。
AgentHabit基准与模型差异
在HABIT基础上,研究构建了AgentHabit基准,通过86项日常任务的轨迹来描绘各智能体的行为倾向。对18个模型的画像分析揭示了显著的流派差异:面对需求冲突时,多数GPT与Claude模型会主动声明自身假设并提供替代方案;而Qwen与Google的模型则更倾向于不作说明,直接保留假设或更改需求。这表明不同厂商的基座模型在行为模式上存在可观测的系统性差异,而非单纯的随机波动。
行为倾向的稳定性与干预
研究进一步验证了这些行为画像的泛化性与可塑性。即便使用完全不同的任务集构建画像,各模型的行为特征依然可被识别,说明其反映的是超越特定任务的通用倾向。在干预实验中,通过提示词要求智能体采纳特定行为,仅能轻易改变部分行为轴,对其他轴几乎无效;而使用其他模型的轨迹进行微调,也只能改变模型画像的一部分,大量原有特征依然保留。这揭示了智能体行为倾向具有深层固有性,简单干预难以彻底重塑。
为什么值得看
揭示主流大模型在任务执行方式上的深层行为差异与稳定性,为开发更契合用户偏好的智能体提供系统评估框架。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
