探索性数据分析(EDA)提示词:拿到新数据集先看什么(数据质量 + 分布 + 关系 + 分析报告)
刚拿到一份不熟悉的数据集、要在建模或写分析报告之前先摸清数据时用:按固定流程生成 EDA 代码与检查清单,读懂输出后整理成「发现 + 证据 + 下一步」的探索性分析报告,并提前识别数据泄露、样本偏差这类会让结论失效的问题。
通用大模型 对话模型通用
【角色】你是一名严谨的数据科学家。做 EDA 时你关心的不是画了多少张图,而是:这份数据能不能回答业务问题、哪里不可信、下一步该分析什么。 【背景】 - 业务问题:[业务问题] - 数据来源与采集方式:[数据来源与采集方式] - 数据粒度(一行代表什么):[一行代表什么] - 目标变量(没有就写无):[目标变量] - 工具:[Python pandas/R/SQL] - 数据概况(df.info()、df.describe(include="all") 的输出,或前 20 行样例): [数据概况] 【分析流程】按顺序进行,每一步说明「看什么、为什么看、怎么看」,并给出代码: 1. 结构核对:行数、列数、类型是否符合预期;一行是否真的代表我说的粒度(检查主键是否唯一)。 2. 数据质量:缺失(比例与模式,是否集中在某段时间或某类用户)、重复、异常值、取值越界、口径不一致的字段。 3. 单变量分布:数值变量看分布形状、偏度、长尾;分类变量看取值个数和占比,基数过高或占比极小的类别要单独指出。 4. 目标变量:分布与是否类别不平衡;随时间的变化。 5. 双变量关系:各特征与目标变量的关系,特征之间的相关性与共线性;对关键发现做分组对比,警惕辛普森悖论。 6. 时间维度:趋势、季节性、断点(某天数据量骤变往往是埋点或口径变更)。 7. 风险检查:数据泄露(特征里含有结果发生之后才能知道的信息)、样本选择偏差、幸存者偏差。 【报告要求】 在我贴回代码运行结果后,整理成 EDA 报告: - 一段话结论:数据能否支持业务问题,可信度如何; - 关键发现表:发现 | 证据(具体数字或图表)| 对业务问题的意义 | 可信度; - 数据质量问题清单及处理建议; - 下一步分析或建模建议。 【约束】 - 只根据我贴出的结果下结论,没看到数据之前不要给出具体发现。 - 相关不等于因果,涉及因果的表述必须写明需要什么额外证据。 - 图表代码统一使用 matplotlib 或 seaborn,每张图都要有标题、坐标轴名称和单位。
高亮处换成你自己的内容:[业务问题]、[数据来源与采集方式]、[一行代表什么]、[目标变量]、[Python pandas/R/SQL]、[数据概况]
ChatGPT Plus 充值
已被复制 0 次
使用说明
怎么填变量:[一行代表什么] 是最容易被忽略、又最影响结论的信息:「一行是一个订单」和「一行是订单里的一件商品」,算出来的客单价完全不同。[数据概况] 不方便上传原始数据时,贴 df.info() 和 df.describe(include="all") 的输出就足够开始,后续按它给的代码在本地运行,只贴统计结果。
常见坑:
- 一上来就画几十张图,最后没有结论;模板要求每一步都说明「为什么看」。
- 用均值描述长尾数据(如消费金额),被少数大额用户拉高,要同时看中位数和分位数。
- 数据泄露在 EDA 阶段最容易发现,比如预测「是否流失」时,特征里有「注销时间」。
追问技巧:对某个发现追问「这个结论最可能被什么混杂因素推翻,怎么验证」;写汇报时说「把报告压缩成 5 页 PPT 的大纲,每页一个结论」。
示例输出
示例,仅供参考(关键发现表节选,数据:电商用户 90 天行为)
| 发现 | 证据 | 意义 | 可信度 |
|---|---|---|---|
| 8 月 12 日起「浏览次数」整体下降约 40% | 日均值从 23.1 降到 13.8,所有渠道同时下降 | 更像埋点变更而非真实下滑,需与研发确认 | 中 |
| 新客复购率明显低于老客 | 新客 30 天复购 8.2%,老客 21.5% | 新客转化值得单独分析 | 高 |
| 「优惠券使用」与复购强相关 | 相关系数 0.46 | 可能是高意向用户更爱用券,不能直接推出「发券提升复购」 | 低(因果待验证) |
同款作品
用这条提示词做出来的作品;原作者会因此获得积分
还没有同款,来做第一个。






0 条评论
还没有评论,来抢沙发~