实验设计者

experiment-designer
分类写作
作者Alireza Rezvani
许可MIT
评分4.50/5
使用8.1K

实验设计专家 (Experiment Designer)

通过清晰的假设和有据可依的决策,设计、优先级排序并评估产品实验。

使用场景

适用于:

  • A/B 测试和多变量实验规划

  • 编写假设及定义成功标准

  • 样本量和最小可检测效应 (MDE) 规划

  • 使用 ICE 评分进行实验优先级排序

  • 解读统计输出以做出产品决策

核心工作流

1. 以“如果/那么/因为”格式编写假设

  • 如果我们改变 [干预措施]

  • 那么 [指标] 将会 [预期方向/幅度] 变化

  • 因为 [行为机制]

2. 在运行测试前定义指标

  • 核心指标 (Primary metric):单一的决策指标

  • 护栏指标 (Guardrail metrics):质量/风险保护指标

  • 次要指标 (Secondary metrics):仅用于诊断

3. 估算样本量

  • 基准转化率或基准均值

  • 最小可检测效应 (MDE)

  • 显著性水平 (alpha) 和统计功效 (power)

使用:

bash
python3 scripts/sample_size_calculator.py --baseline-rate 0.12 --mde 0.02 --mde-type absolute

4. 使用 ICE 评估实验优先级

  • 影响力 (Impact):潜在的提升空间

  • 置信度 (Confidence):证据质量

  • 易行度 (Ease):成本/速度/复杂度

ICE 分数 = (影响力 * 置信度 * 易行度) / 10

5. 设定停止规则并发布

  • 提前决定固定样本量或固定时长

  • 避免在没有正确方法的情况下频繁查看结果 (Peeking)

  • 持续监控护栏指标

6. 解读结果

  • 统计显著性 $\neq$ 业务显著性

  • 将点估计值 + 置信区间与决策阈值进行比较

  • 调查新奇效应 (Novelty effects) 和分群异质性

假设质量检查清单

  • [ ] 包含明确的干预措施和目标受众
  • [ ] 指定了可衡量的指标变化
  • [ ] 陈述了合理的因果原因
  • [ ] 包含预期的最小效应
  • [ ] 定义了失败条件

常见实验陷阱

  • 统计功效不足导致假阴性 (False Negatives)
  • 同时运行过多未隔离的变更
  • 在测试中途更改目标人群或实现方案
  • 在出现随机波动时过早停止实验
  • 忽略样本比例失衡 (SRM) 和埋点漂移
  • 仅凭 p 值宣布成功而忽略效应量 (Effect size) 的背景

统计解读准则

  • p-value < alpha 表示有证据反对原假设,而非绝对真理。
  • 置信区间跨越零点/无效应点意味着方向性结论不确定。
  • 即使显著,宽置信区间也意味着精度较低。
  • 使用与业务影响挂钩的实际显著性阈值。

参考:

  • references/experiment-playbook.md

  • references/statistics-reference.md

工具

scripts/sample_size_calculator.py

根据以下参数计算所需样本量(单组及总计):

  • 基准率 (baseline rate)

  • MDE(绝对值或相对值)

  • 显著性水平 (alpha)

  • 统计功效 (power)

示例:

bash
python3 scripts/sample_size_calculator.py \
--baseline-rate 0.10 \
--mde 0.015 \
--mde-type absolute \
--alpha 0.05 \
--power 0.8