用 AI 生成合成数据提示词(为测试、评测或训练批量造样本:多样性维度矩阵、去重、标注一致性、真实感检查)
缺少真实数据来测试大模型应用、建立评测集、训练分类模型,或者真实数据涉及隐私不能直接使用时用:AI 帮你先定义多样性维度、按矩阵分批生成样本,避免千篇一律,并给出去重、标注一致性检查和与真实数据对比的方法。
通用大模型 对话模型通用
你是一名擅长构造高质量合成数据的数据工程师。请帮我设计并生成一批合成数据。 - 数据用途:[数据用途](例:测试客服机器人对退货问题的回答) - 单条样本的格式:[样本格式](例:用户问题 + 期望的处理类别 + 难度) - 需要的数量:[需要的数量] - 已有的少量真实样本(已脱敏,用于参考风格): [真实样本] - 必须覆盖的情况:[必须覆盖](例:情绪激动的用户、信息不全、一次问多个问题) 请按以下步骤: 1. 多样性维度:列出决定样本差异的维度及其取值,例如: - 内容维度:问题类型、涉及的商品品类; - 表达维度:长度、语气(平静、着急、愤怒)、是否有错别字或口语化、是否夹杂方言或英文; - 难度维度:信息是否完整、是否含多个意图、是否有误导信息。 2. 生成计划:按维度组合成一张矩阵,规定每种组合生成多少条,保证分布合理(常见情况多、极端情况少但一定要有),不要让模型「自由发挥」。 3. 生成提示词:每一批只生成一个维度组合,要求: - 每条样本彼此明显不同,不要只是替换几个词; - 不要照抄参考样本; - 不包含真实的人名、手机号、地址、订单号(如需要,用明显的虚构格式); - 同时输出标注(期望类别等),并对模棱两可的样本给出理由。 4. 质量检查: - 去重:完全重复与高度相似的样本如何检测(例如文本相似度阈值); - 标注一致性:抽样让另一个模型或人工独立标注,比较一致率; - 真实感:与真实样本对比长度分布、用词,指出合成数据「过于工整」的问题; - 偏差:检查是否某类样本比例失衡、是否带有刻板印象。 5. 使用建议:合成数据适合什么、不适合什么;评测时为什么仍要保留一部分真实数据。 先输出维度矩阵与生成计划,再生成第一批 [首批数量] 条作为示范。
高亮处换成你自己的内容:[数据用途]、[样本格式]、[需要的数量]、[真实样本]、[必须覆盖]、[首批数量]
ChatGPT Plus 充值
已被复制 0 次
使用说明
怎么填变量:[真实样本] 即使只有几条,也能帮助 AI 把握真实用户的说话方式,生成的数据会更像真的。[必须覆盖] 写出你最担心系统处理不好的情况,这些情况在合成数据中要有足够的数量。
常见坑:
- 一次让模型生成 200 条,后面的样本越来越像,大量近似重复。按维度组合分批生成,每批数量适中。
- 合成的用户问题都很「标准」:句子完整、没有错别字、一次只问一个问题,和真实用户差别很大,用来评测会高估系统的效果。
- 用同一个模型生成数据、再用同一个模型评测,可能存在偏向自己的风格。有条件时混用不同模型,并保留真实数据作为对照。
追问技巧:追问「检查这批数据中哪些维度组合的样本质量最差,重新生成」,或「把生成和去重流程写成脚本,可以重复运行」。评测集的设计可配合 1142 号提示词,造测试用的结构化假数据可配合 1015 号提示词。
示例输出
示例,仅供参考(维度矩阵节选)
| 问题类型 | 语气 | 信息完整度 | 数量 |
|---|---|---|---|
| 尺码不合适想换货 | 平静 | 完整 | 15 |
| 尺码不合适想换货 | 着急 | 缺少订单信息 | 8 |
| 商品破损 | 愤怒 | 完整,附带要求赔偿 | 8 |
| 超过退货期限仍想退 | 平静 | 完整 | 6 |
| 同时询问退货与发票 | 着急 | 部分缺失 | 5 |
第一批示例(商品破损 · 愤怒):
json
[
{"text": "你们怎么包的??杯子到手碎成三块,我要全额退款外加赔偿,今天不处理我就投诉", "label": "破损-退款", "difficulty": "中"},
{"text": "第二次了!!上次碗也是裂的,这次盘子又磕掉一块,到底有没有人管", "label": "破损-退款", "difficulty": "中", "note": "未明确提出诉求,但情绪与历史问题需要关注"}
]同款作品
用这条提示词做出来的作品;原作者会因此获得积分
还没有同款,来做第一个。


0 条评论
还没有评论,来抢沙发~