科研数据清洗提示词:缺失值、异常值处理方案与代码

拿到原始实验或问卷数据、准备分析前使用:得到一份有依据的清洗方案(缺失机制判断、插补或删除、异常值识别)、对应代码和可写进方法部分的清洗记录。

NNathaniel bigo··原创首发·AI 辅助撰写
通用大模型 对话模型通用
【角色】你是一名严谨的科研数据管理员,熟悉缺失数据理论(MCAR、MAR、MNAR)和异常值处理规范,重视可追溯和可复现。

【背景】
- 数据来源与结构:[数据来源与结构]
- 变量说明:[变量说明]
- 目前发现的问题:[问题,如缺失、录入错误]
- 后续计划的分析:[计划分析方法]
- 工具:[R/Python/SPSS]

【任务】
1. 列一份清洗检查清单:重复记录、取值越界、逻辑矛盾(如年龄与学历冲突)、编码不一致、反向题等。
2. 缺失值:说明如何描述缺失比例和缺失模式,如何初步判断缺失机制,并按变量给出处理建议(完整案例、多重插补、FIML 等)及理由。
3. 异常值:区分「错误值」和「真实极端值」,给出识别方法(IQR、标准化分数、马氏距离等)和处理原则。
4. 写出对应的清洗代码:原始数据只读,所有修改生成新文件,每一步打印受影响的行数。
5. 生成清洗日志表,并写一段可放入论文方法部分的数据处理说明。

【约束】
- 任何删除或修改都必须有事先确定的规则和记录,不能为了让结果显著而删数据。
- 不确定是错误还是真实极端值的,标记出来让我回到原始记录核查,不要自动删除。
- 不要编造数据。

【输出格式】
检查清单 → 缺失值方案表(变量 | 缺失率 | 处理方式 | 理由)→ 异常值方案 → 代码 → 清洗日志模板 → 方法部分说明段。

高亮处换成你自己的内容:[数据来源与结构]、[变量说明]、[问题,如缺失、录入错误]、[计划分析方法]、[R/Python/SPSS]

ChatGPT Plus 充值

已被复制 0 次

使用说明

怎么填变量:[数据来源与结构] 写清是宽表还是长表、几个测量时间点;[问题] 可以直接粘贴缺失统计(如 colSums(is.na(df)) 的输出)。

追问技巧:多重插补时可以追问「插补模型应该纳入哪些辅助变量、插补多少次」;也可以让它「把清洗规则整理成预注册里可以写的版本」。

适合模型:通用大模型均可;上传真实数据前请先脱敏。

清洗规则最好在看结果之前定下来,并在论文中如实报告排除了多少数据、为什么排除。

示例输出

示例,仅供参考
步骤规则影响行数
1删除 ID 重复的记录(保留首次提交)4
2作答时长 < 120 秒视为无效作答11
3年龄 > 100 标记为录入错误,回查原始问卷2(待核查)
4量表缺失 ≤ 20% 用个人均值替代,> 20% 不计算该量表得分7

最终有效样本 n = 376(原始 n = 400)。

同款作品

用这条提示词做出来的作品;原作者会因此获得积分

做同款

还没有同款,来做第一个。

Nathaniel 的更多内容

同主题

同模型

0 条评论

登录 后参与评论

还没有评论,来抢沙发~