探索性数据分析(EDA)提示词:拿到新数据集先看什么(数据质量 + 分布 + 关系 + 分析报告)

刚拿到一份不熟悉的数据集、要在建模或写分析报告之前先摸清数据时用:按固定流程生成 EDA 代码与检查清单,读懂输出后整理成「发现 + 证据 + 下一步」的探索性分析报告,并提前识别数据泄露、样本偏差这类会让结论失效的问题。

NNathaniel bigo··原创首发·AI 辅助撰写
通用大模型 对话模型通用
【角色】你是一名严谨的数据科学家。做 EDA 时你关心的不是画了多少张图,而是:这份数据能不能回答业务问题、哪里不可信、下一步该分析什么。

【背景】
- 业务问题:[业务问题]
- 数据来源与采集方式:[数据来源与采集方式]
- 数据粒度(一行代表什么):[一行代表什么]
- 目标变量(没有就写无):[目标变量]
- 工具:[Python pandas/R/SQL]
- 数据概况(df.info()、df.describe(include="all") 的输出,或前 20 行样例):
  [数据概况]

【分析流程】按顺序进行,每一步说明「看什么、为什么看、怎么看」,并给出代码:
1. 结构核对:行数、列数、类型是否符合预期;一行是否真的代表我说的粒度(检查主键是否唯一)。
2. 数据质量:缺失(比例与模式,是否集中在某段时间或某类用户)、重复、异常值、取值越界、口径不一致的字段。
3. 单变量分布:数值变量看分布形状、偏度、长尾;分类变量看取值个数和占比,基数过高或占比极小的类别要单独指出。
4. 目标变量:分布与是否类别不平衡;随时间的变化。
5. 双变量关系:各特征与目标变量的关系,特征之间的相关性与共线性;对关键发现做分组对比,警惕辛普森悖论。
6. 时间维度:趋势、季节性、断点(某天数据量骤变往往是埋点或口径变更)。
7. 风险检查:数据泄露(特征里含有结果发生之后才能知道的信息)、样本选择偏差、幸存者偏差。

【报告要求】
在我贴回代码运行结果后,整理成 EDA 报告:
- 一段话结论:数据能否支持业务问题,可信度如何;
- 关键发现表:发现 | 证据(具体数字或图表)| 对业务问题的意义 | 可信度;
- 数据质量问题清单及处理建议;
- 下一步分析或建模建议。

【约束】
- 只根据我贴出的结果下结论,没看到数据之前不要给出具体发现。
- 相关不等于因果,涉及因果的表述必须写明需要什么额外证据。
- 图表代码统一使用 matplotlib 或 seaborn,每张图都要有标题、坐标轴名称和单位。

高亮处换成你自己的内容:[业务问题]、[数据来源与采集方式]、[一行代表什么]、[目标变量]、[Python pandas/R/SQL]、[数据概况]

ChatGPT Plus 充值

已被复制 0 次

使用说明

怎么填变量:[一行代表什么] 是最容易被忽略、又最影响结论的信息:「一行是一个订单」和「一行是订单里的一件商品」,算出来的客单价完全不同。[数据概况] 不方便上传原始数据时,贴 df.info() 和 df.describe(include="all") 的输出就足够开始,后续按它给的代码在本地运行,只贴统计结果。

常见坑:

  • 一上来就画几十张图,最后没有结论;模板要求每一步都说明「为什么看」。
  • 用均值描述长尾数据(如消费金额),被少数大额用户拉高,要同时看中位数和分位数。
  • 数据泄露在 EDA 阶段最容易发现,比如预测「是否流失」时,特征里有「注销时间」。

追问技巧:对某个发现追问「这个结论最可能被什么混杂因素推翻,怎么验证」;写汇报时说「把报告压缩成 5 页 PPT 的大纲,每页一个结论」。

示例输出

示例,仅供参考(关键发现表节选,数据:电商用户 90 天行为)
发现证据意义可信度
8 月 12 日起「浏览次数」整体下降约 40%日均值从 23.1 降到 13.8,所有渠道同时下降更像埋点变更而非真实下滑,需与研发确认中
新客复购率明显低于老客新客 30 天复购 8.2%,老客 21.5%新客转化值得单独分析高
「优惠券使用」与复购强相关相关系数 0.46可能是高意向用户更爱用券,不能直接推出「发券提升复购」低(因果待验证)

同款作品

用这条提示词做出来的作品;原作者会因此获得积分

做同款

还没有同款,来做第一个。

Nathaniel 的更多内容

同模型

0 条评论

登录 后参与评论

还没有评论,来抢沙发~