实验设计者
experiment-designer
实验设计专家 (Experiment Designer)
通过清晰的假设和有据可依的决策,设计、优先级排序并评估产品实验。
使用场景
适用于:
- A/B 测试和多变量实验规划
- 编写假设及定义成功标准
- 样本量和最小可检测效应 (MDE) 规划
- 使用 ICE 评分进行实验优先级排序
- 解读统计输出以做出产品决策
核心工作流
1. 以“如果/那么/因为”格式编写假设
- 如果我们改变
[干预措施]
- 那么
[指标]将会[预期方向/幅度]变化
- 因为
[行为机制]
2. 在运行测试前定义指标
- 核心指标 (Primary metric):单一的决策指标
- 护栏指标 (Guardrail metrics):质量/风险保护指标
- 次要指标 (Secondary metrics):仅用于诊断
3. 估算样本量
- 基准转化率或基准均值
- 最小可检测效应 (MDE)
- 显著性水平 (alpha) 和统计功效 (power)
使用:
bash
python3 scripts/sample_size_calculator.py --baseline-rate 0.12 --mde 0.02 --mde-type absolute4. 使用 ICE 评估实验优先级
- 影响力 (Impact):潜在的提升空间
- 置信度 (Confidence):证据质量
- 易行度 (Ease):成本/速度/复杂度
ICE 分数 = (影响力 * 置信度 * 易行度) / 10
5. 设定停止规则并发布
- 提前决定固定样本量或固定时长
- 避免在没有正确方法的情况下频繁查看结果 (Peeking)
- 持续监控护栏指标
6. 解读结果
- 统计显著性 $\neq$ 业务显著性
- 将点估计值 + 置信区间与决策阈值进行比较
- 调查新奇效应 (Novelty effects) 和分群异质性
假设质量检查清单
- [ ] 包含明确的干预措施和目标受众
- [ ] 指定了可衡量的指标变化
- [ ] 陈述了合理的因果原因
- [ ] 包含预期的最小效应
- [ ] 定义了失败条件
常见实验陷阱
- 统计功效不足导致假阴性 (False Negatives)
- 同时运行过多未隔离的变更
- 在测试中途更改目标人群或实现方案
- 在出现随机波动时过早停止实验
- 忽略样本比例失衡 (SRM) 和埋点漂移
- 仅凭 p 值宣布成功而忽略效应量 (Effect size) 的背景
统计解读准则
- p-value < alpha 表示有证据反对原假设,而非绝对真理。
- 置信区间跨越零点/无效应点意味着方向性结论不确定。
- 即使显著,宽置信区间也意味着精度较低。
- 使用与业务影响挂钩的实际显著性阈值。
参考:
references/experiment-playbook.md
references/statistics-reference.md
工具
scripts/sample_size_calculator.py
根据以下参数计算所需样本量(单组及总计):
- 基准率 (baseline rate)
- MDE(绝对值或相对值)
- 显著性水平 (alpha)
- 统计功效 (power)
示例:
bash
python3 scripts/sample_size_calculator.py \
--baseline-rate 0.10 \
--mde 0.015 \
--mde-type absolute \
--alpha 0.05 \
--power 0.8