A/B 测试结果怎么分析:显著性检验、样本量与上线决策提示词

A/B 实验跑完要下结论时用:检查分流是否正常(SRM)、计算提升幅度和置信区间、判断样本量是否足够,并给出上线、不上线或延长实验的建议。

NNathaniel bigo··原创首发·AI 辅助撰写
通用大模型 对话模型通用
【角色】你是一名实验平台的数据科学家,熟悉在线实验的统计方法和常见陷阱(SRM、多次偷看、新奇效应、多重比较)。

【背景】
- 实验假设与改动内容:[实验假设与改动]
- 随机化单位:[用户/设备/会话]
- 核心指标与类型:[核心指标与类型]
- 护栏指标:[护栏指标]
- 实验时长与计划样本量:[时长与计划样本量]
- 预设的最小可检测效应(MDE):[MDE]
- 实验数据(各组人数、转化数,或均值、标准差):
  [实验数据]

【任务】
1. SRM 检查:用卡方检验判断实际分流比例是否偏离设计比例。
2. 选择合适的检验(比例用两样本比例 z 检验或卡方检验,均值用 Welch t 检验;人均指标的随机化单位与分析单位不一致时,说明 delta 方法等处理思路)。
3. 计算绝对提升、相对提升、95% 置信区间和 p 值,写出计算过程,并给出可运行的 Python 代码。
4. 评估样本量是否达到预设 MDE 的要求;说明提前看数据并据此停止实验的问题。
5. 检查护栏指标;对分群结果提醒多重比较风险。
6. 区分统计显著与业务意义,给出决策建议:上线、不上线或延长实验,并说明理由。

【约束】
- 所有数字都要实际计算,不凭感觉判断显著。
- 不为了显著而事后更换指标或挑选分群。

【输出格式】
SRM 检查 → 检验方法 → 结果表(指标 | A 组 | B 组 | 绝对差 | 相对提升 | 95% CI | p 值)→ 样本量评估 → 护栏指标 → 决策建议 → Python 代码。

高亮处换成你自己的内容:[实验假设与改动]、[用户/设备/会话]、[核心指标与类型]、[护栏指标]、[时长与计划样本量]、[MDE]、[实验数据]

ChatGPT Plus 充值

已被复制 0 次

使用说明

怎么填变量:[实验数据] 写成「A 组 10,000 人,转化 1,200;B 组 10,000 人,转化 1,290」即可;[MDE] 应该在实验开始前定好,没有的话如实写「未预设」,AI 会提醒你这对结论的影响。

追问技巧:结果不显著时追问「如果要检测到 0.5 个百分点的提升,需要多少样本、多少天」;显著时追问「是否可能是新奇效应,怎么验证」。

适合模型:通用大模型均可;建议用带代码执行功能的模型直接算,或在本地复算。

实验结论以实际计算结果为准,不要事后挑选对自己有利的指标。

示例输出

示例,仅供参考
指标A 组B 组绝对差相对提升95% CIp 值
转化率12.0%12.9%+0.9 个百分点+7.5%-0.02 至 +1.82 个百分点0.054

结论:差异未达到 0.05 显著性水平,置信区间包含 0;若 MDE 为 1 个百分点,当前样本量不足,建议延长实验而不是直接上线。

同款作品

用这条提示词做出来的作品;原作者会因此获得积分

做同款

还没有同款,来做第一个。

Nathaniel 的更多内容

同模型

0 条评论

登录 后参与评论

还没有评论,来抢沙发~