数据标注规范怎么写:标注指南与一致性检验方案提示词(标签定义、边界案例、试标与修订流程)

要组织几个人(或用大模型)给一批数据打标签,用于训练、评测或统计,担心每个人理解不一样、标出来的数据没法用时用:给出任务和样本,AI 起草一份标注指南——每个标签的定义、正反例、容易混的边界怎么判——并设计试标、算一致性、修订规则的流程。

NNathaniel bigo··原创首发·AI 辅助撰写
通用大模型 对话模型通用
我需要为一个标注任务编写标注指南,并设计保证标注质量的流程。请基于我提供的真实样本来写,不要凭空想象数据的样子。

标注任务:[标注任务]
标注结果的用途:[标注用途](训练模型 / 做评测集 / 业务统计)
初步设想的标签:[初步标签]
真实样本(20–50 条,尽量包含你觉得难判断的):
[真实样本]
标注人员情况:[标注人员](人数、是否有领域知识、是否使用大模型预标注)

第一步:先看数据再定标签
1. 通读样本,指出初步标签体系的问题:是否有重叠、是否有样本哪类都不属于、粒度是否不一致、某类是否几乎不会出现。
2. 提出修改后的标签体系,并说明每处修改的理由。标签是单选还是多选要明确。
3. 从我的样本中挑出最难判断的 8–10 条,说明难在哪里——这些就是指南要重点解决的边界情况。

第二步:撰写标注指南,包含
1. 任务说明:标什么、为什么标(用途会影响拿不准时的取舍)、标注的最小单位是什么。
2. 每个标签:一句话定义;判定标准(满足什么条件才算);2 个典型正例;1–2 个「看起来像但不是」的反例及原因。例子优先取自我的样本。
3. 边界规则:把最容易混淆的标签两两列出,给出判定优先级(例如「同时出现 A 和 B 时标 A,因为……」)。
4. 通用规则:信息不足、内容为空、无关内容、多语言、含错别字、讽刺反话等情况分别怎么处理;什么时候使用「无法判断」,并说明这个选项不应被滥用。
5. 判定流程:把上述规则整理成一个自上而下的判断顺序(先问什么、再问什么),让标注员不用通读全文也能照着走。
6. 不要做的事:不凭个人好恶、不根据猜测的作者身份、不自行新增标签。

第三步:质量流程
1. 试标:先由所有人独立标注同一小批数据,计算一致性(两人用 Cohen's kappa,多人用 Fleiss' kappa 或 Krippendorff's alpha),说明各自适用的情况,以及为什么不能只看简单的一致比例。
2. 分歧处理:把不一致的样本逐条讨论,把结论补充进指南的边界规则,而不是只改这一条的答案;指南要有版本号和修订记录。
3. 正式标注:重叠标注的比例、抽检方式、埋入已知答案的检查题、发现某位标注员系统性偏差时怎么办。
4. 使用大模型预标注时:人工复核的抽样方式;如何避免标注员被预标注结果带偏;模型与人工不一致的样本如何处理。
5. 交付物:标注数据的字段、每条的标注人与时间、存疑标记、指南版本。

一致性系数多高算合格取决于任务的主观程度和用途,请说明判断思路,由我来定具体门槛,不要给一个放之四海皆准的数字。

高亮处换成你自己的内容:[标注任务]、[标注用途]、[初步标签]、[真实样本]、[标注人员]

ChatGPT Plus 充值

已被复制 0 次

使用说明

标注质量差,多数时候是指南的问题。让三个人给同一批评论标「正面 / 负面 / 中性」,如果指南只有这三个词,一致性一定不高——「东西不错,就是太贵」算哪类?标注指南要解决的就是这些边界;而边界只有看了真实数据才知道在哪,所以提示词的第一步是先读样本、先挑难例,再写定义。

怎么填变量:[真实样本] 是关键,请直接从要标的数据里随机抽,再手动补几条你觉得难办的;不要用自己编的「典型例子」,那样写出的指南只能处理简单情况。[标注用途] 要写清:用于训练时,宁可把含糊的样本单独标记出来;用于业务统计时,更需要每条都有明确归属。数据含个人信息的,先脱敏再贴。

关于一致性系数:简单的一致比例会被「碰巧一致」抬高——类别很不均衡时,两个人全标成多数类也能有很高的一致率,kappa 这类系数扣除了这部分偶然一致。系数达到多少可以接受,没有统一标准,主观性强的任务本来就难以很高,结合用途和分歧样本的具体情况来判断。

常见问题与调整:

  • 指南越写越长,标注员记不住 → 追问:「把指南压缩成一页的判定流程图文字版,细则作为附录。」
  • 试标一致性低 → 把分歧样本贴回来:「这些是两人标注不一致的样本及各自的标签,请归纳分歧集中在哪几对标签上,并为每一对补充判定规则。」
  • 用大模型标注 → 把指南直接作为提示词的主体,并配合本站「文本分类提示词怎么写」与「Few-shot 示例怎么写提示词」。

示例输出

示例,仅供参考(任务:给电商评论标注「是否包含质量问题反馈」;节选)

难例与原因

  • 「用了两周就不太灵了,不知道是不是我用得不对」——有质量疑似问题,但用户自己不确定。
  • 「快递盒压扁了,里面没事」——是物流问题,商品本身无问题。

标签定义:包含质量问题

定义:评论描述了商品本身的缺陷、损坏、故障或与描述不符。

判定标准:问题出在商品上(而非物流、客服、价格),且描述的是已经发生的情况。

正例:「充电口松动,插上经常断电。」

反例:「包装太简陋了。」——针对的是包装而非商品,标「不包含」。

边界规则

  • 用户不确定是否为质量问题(如上面第一条):标「包含」,并勾选「存疑」。理由:本数据用于发现潜在质量问题,漏掉的代价高于多看一条。
  • 只有外包装受损、商品完好:标「不包含」。

判定流程:先问「评论是否提到了商品本身的状况」→ 否,标不包含;是,再问「描述的是不是缺陷、故障或不符」→ 是,标包含。

同款作品

用这条提示词做出来的作品;原作者会因此获得积分

做同款

还没有同款,来做第一个。

Nathaniel 的更多内容

同主题

同模型

0 条评论

登录 后参与评论

还没有评论,来抢沙发~