用 AI 生成合成数据提示词(为测试、评测或训练批量造样本:多样性维度矩阵、去重、标注一致性、真实感检查)

缺少真实数据来测试大模型应用、建立评测集、训练分类模型,或者真实数据涉及隐私不能直接使用时用:AI 帮你先定义多样性维度、按矩阵分批生成样本,避免千篇一律,并给出去重、标注一致性检查和与真实数据对比的方法。

NNathaniel bigo··原创首发·AI 辅助撰写
通用大模型 对话模型通用
你是一名擅长构造高质量合成数据的数据工程师。请帮我设计并生成一批合成数据。

- 数据用途:[数据用途](例:测试客服机器人对退货问题的回答)
- 单条样本的格式:[样本格式](例:用户问题 + 期望的处理类别 + 难度)
- 需要的数量:[需要的数量]
- 已有的少量真实样本(已脱敏,用于参考风格):
  [真实样本]
- 必须覆盖的情况:[必须覆盖](例:情绪激动的用户、信息不全、一次问多个问题)

请按以下步骤:
1. 多样性维度:列出决定样本差异的维度及其取值,例如:
   - 内容维度:问题类型、涉及的商品品类;
   - 表达维度:长度、语气(平静、着急、愤怒)、是否有错别字或口语化、是否夹杂方言或英文;
   - 难度维度:信息是否完整、是否含多个意图、是否有误导信息。
2. 生成计划:按维度组合成一张矩阵,规定每种组合生成多少条,保证分布合理(常见情况多、极端情况少但一定要有),不要让模型「自由发挥」。
3. 生成提示词:每一批只生成一个维度组合,要求:
   - 每条样本彼此明显不同,不要只是替换几个词;
   - 不要照抄参考样本;
   - 不包含真实的人名、手机号、地址、订单号(如需要,用明显的虚构格式);
   - 同时输出标注(期望类别等),并对模棱两可的样本给出理由。
4. 质量检查:
   - 去重:完全重复与高度相似的样本如何检测(例如文本相似度阈值);
   - 标注一致性:抽样让另一个模型或人工独立标注,比较一致率;
   - 真实感:与真实样本对比长度分布、用词,指出合成数据「过于工整」的问题;
   - 偏差:检查是否某类样本比例失衡、是否带有刻板印象。
5. 使用建议:合成数据适合什么、不适合什么;评测时为什么仍要保留一部分真实数据。

先输出维度矩阵与生成计划,再生成第一批 [首批数量] 条作为示范。

高亮处换成你自己的内容:[数据用途]、[样本格式]、[需要的数量]、[真实样本]、[必须覆盖]、[首批数量]

ChatGPT Plus 充值

已被复制 0 次

使用说明

怎么填变量:[真实样本] 即使只有几条,也能帮助 AI 把握真实用户的说话方式,生成的数据会更像真的。[必须覆盖] 写出你最担心系统处理不好的情况,这些情况在合成数据中要有足够的数量。

常见坑:

  • 一次让模型生成 200 条,后面的样本越来越像,大量近似重复。按维度组合分批生成,每批数量适中。
  • 合成的用户问题都很「标准」:句子完整、没有错别字、一次只问一个问题,和真实用户差别很大,用来评测会高估系统的效果。
  • 用同一个模型生成数据、再用同一个模型评测,可能存在偏向自己的风格。有条件时混用不同模型,并保留真实数据作为对照。

追问技巧:追问「检查这批数据中哪些维度组合的样本质量最差,重新生成」,或「把生成和去重流程写成脚本,可以重复运行」。评测集的设计可配合 1142 号提示词,造测试用的结构化假数据可配合 1015 号提示词。

示例输出

示例,仅供参考(维度矩阵节选)
问题类型语气信息完整度数量
尺码不合适想换货平静完整15
尺码不合适想换货着急缺少订单信息8
商品破损愤怒完整,附带要求赔偿8
超过退货期限仍想退平静完整6
同时询问退货与发票着急部分缺失5

第一批示例(商品破损 · 愤怒):

json
[
  {"text": "你们怎么包的??杯子到手碎成三块,我要全额退款外加赔偿,今天不处理我就投诉", "label": "破损-退款", "difficulty": "中"},
  {"text": "第二次了!!上次碗也是裂的,这次盘子又磕掉一块,到底有没有人管", "label": "破损-退款", "difficulty": "中", "note": "未明确提出诉求,但情绪与历史问题需要关注"}
]

同款作品

用这条提示词做出来的作品;原作者会因此获得积分

做同款

还没有同款,来做第一个。

Nathaniel 的更多内容

同主题

同模型

0 条评论

登录 后参与评论

还没有评论,来抢沙发~