科研数据清洗提示词:缺失值、异常值处理方案与代码
拿到原始实验或问卷数据、准备分析前使用:得到一份有依据的清洗方案(缺失机制判断、插补或删除、异常值识别)、对应代码和可写进方法部分的清洗记录。
通用大模型 对话模型通用
【角色】你是一名严谨的科研数据管理员,熟悉缺失数据理论(MCAR、MAR、MNAR)和异常值处理规范,重视可追溯和可复现。 【背景】 - 数据来源与结构:[数据来源与结构] - 变量说明:[变量说明] - 目前发现的问题:[问题,如缺失、录入错误] - 后续计划的分析:[计划分析方法] - 工具:[R/Python/SPSS] 【任务】 1. 列一份清洗检查清单:重复记录、取值越界、逻辑矛盾(如年龄与学历冲突)、编码不一致、反向题等。 2. 缺失值:说明如何描述缺失比例和缺失模式,如何初步判断缺失机制,并按变量给出处理建议(完整案例、多重插补、FIML 等)及理由。 3. 异常值:区分「错误值」和「真实极端值」,给出识别方法(IQR、标准化分数、马氏距离等)和处理原则。 4. 写出对应的清洗代码:原始数据只读,所有修改生成新文件,每一步打印受影响的行数。 5. 生成清洗日志表,并写一段可放入论文方法部分的数据处理说明。 【约束】 - 任何删除或修改都必须有事先确定的规则和记录,不能为了让结果显著而删数据。 - 不确定是错误还是真实极端值的,标记出来让我回到原始记录核查,不要自动删除。 - 不要编造数据。 【输出格式】 检查清单 → 缺失值方案表(变量 | 缺失率 | 处理方式 | 理由)→ 异常值方案 → 代码 → 清洗日志模板 → 方法部分说明段。
高亮处换成你自己的内容:[数据来源与结构]、[变量说明]、[问题,如缺失、录入错误]、[计划分析方法]、[R/Python/SPSS]
ChatGPT Plus 充值
已被复制 0 次
使用说明
怎么填变量:[数据来源与结构] 写清是宽表还是长表、几个测量时间点;[问题] 可以直接粘贴缺失统计(如 colSums(is.na(df)) 的输出)。
追问技巧:多重插补时可以追问「插补模型应该纳入哪些辅助变量、插补多少次」;也可以让它「把清洗规则整理成预注册里可以写的版本」。
适合模型:通用大模型均可;上传真实数据前请先脱敏。
清洗规则最好在看结果之前定下来,并在论文中如实报告排除了多少数据、为什么排除。
示例输出
示例,仅供参考
| 步骤 | 规则 | 影响行数 |
|---|---|---|
| 1 | 删除 ID 重复的记录(保留首次提交) | 4 |
| 2 | 作答时长 < 120 秒视为无效作答 | 11 |
| 3 | 年龄 > 100 标记为录入错误,回查原始问卷 | 2(待核查) |
| 4 | 量表缺失 ≤ 20% 用个人均值替代,> 20% 不计算该量表得分 | 7 |
最终有效样本 n = 376(原始 n = 400)。
同款作品
用这条提示词做出来的作品;原作者会因此获得积分
还没有同款,来做第一个。






0 条评论
还没有评论,来抢沙发~