临床研究
clinical-research
前瞻性临床研究设计:终点、样本量/功效以及阶段门禁可行性。所有输出均为带有明确假设的估算值,并由指定的负责人审核。本技能绝不将临床建议视为事实,也不能替代生物统计学家或监管事务专员。
目的
研发临床团队、医学监查员和生物统计部门的工作核心在于从“提出假设”到“方案准备提交”之间的阶段。本技能旨在结构化处理三个最困难的设计决策:
三个确定性工具:
1. sample_size_estimator.py — 为两臂设计的均值 (Cohen's d)、比例 (正态近似) 和生存率 (Schoenfeld 事件) 提供闭式功效/样本量计算。包含脱落率补偿。输出时会打印“ESTIMATE — confirm with a biostatistician(估算值 —— 请与生物统计学家确认)”横幅。
2. endpoint_selector.py — 从 5 个加权维度(临床相关性、可测量性、监管认可度、变化敏感度、负担)对候选终点进行评分,并将每个终点分类为 PRIMARY(主要)/ KEY-SECONDARY(关键次要)/ EXPLORATORY(探索性)。会对未经验证的替代终点进行扣分。
3. phase_gate_scorer.py — 针对招募可行性、终点就绪度、统计功效、运营复杂度及预算匹配度,对研究方案进行 0-100 分的评分;返回 GO / GO-WITH-CONDITIONS / REDESIGN / NO-GO 结论,并列出必须签字的负责人。
使用场景
在以下情况调用此技能:
- 您正在选择主要终点,且需要应对关于替代终点的质疑。
- 您需要为方案概要(protocol synopsis)提供一个有据可查的初步样本量估算。
- 研究方案在进行阶段门禁评审前需要可行性评估。
- 您需要压力测试在给定合格人群和中心的情况下,计划的入组人数是否可实现。
不要在以下场景使用此技能:准备监管提交文件或临床评价报告(请使用 ra-qm-team)、寻找或定位资助项目(请使用 research/grants)、设计实时产品 A/B 测试(请使用 product-team/experiment-designer),或替代生物统计学家最终的样本量论证。
工作流
1. 起草概要 — 填写 assets/protocol_synopsis_template.md(目标、设计、人群、终点、统计计划占位符、签字负责人)。
2. 选择终点 — 运行 endpoint_selector.py --input endpoints.json --profile {drug|device|biologic|diagnostic|digital-therapeutic}。阅读分类结果和替代终点标记。如果主要终点 >1 个,请规划多重性控制。
3. 估算样本量 — 运行 sample_size_estimator.py --design {means|proportions|survival} ...。将效应量/差异/风险比(HR)追溯至已发表的文献或基准来源;并针对脱落率进行扩增。
4. 评估可行性 — 运行 phase_gate_scorer.py --input study.json --profile <same> --phase {1|2|3|4}。阅读判定结果 + 阻碍因素 + 指定负责人。
5. 提交审批 — 将概要 + 估算结果汇总至评审包(gate packet)。该评审包为一项建议;需由生物统计师、医学监查员和法规负责人签字。
脚本
| 脚本 | 用途 | 配置方案 (Profiles) |
|---|---|---|
| scripts/sample_size_estimator.py | 均值、比例、生存率的功效/样本量计算 | 不适用(由设计驱动) |
| scripts/endpoint_selector.py | 5 维度终点评分 + 分类 + 替代终点标记 | 药物, 器械, 生物制品, 诊断试剂, 数字疗法 |
| scripts/phase_gate_scorer.py | 可行性评分 (0-100) + 结论 (GO/GO-WITH-CONDITIONS/REDESIGN/NO-GO) + 负责人 | 药物, 器械, 生物制品, 诊断试剂, 数字疗法 |
以上三个脚本均:仅依赖标准库,支持 --help、--sample、--output {human,json}。
入职引导与自定义
在开始之前运行一次入职问卷 —— 它将记录您的默认设置和指定负责人,以便此技能中的每个工具都能预先配置。自定义是核心:您的回答将实际改变工具的行为。
python3 scripts/onboard.py # 交互式(支持:--defaults, --set key=value, --reset)
python3 scripts/onboard.py --show # 查看问题及当前生效的配置答案保存至 ~/.config/research-ops/clinical-research.json(全局)或 ./.research-ops/clinical-research.json(--scope project 项目级),并由 config_loader.py 自动读取。这些设置决定了默认的开发领域 profile、默认的 alpha / power / dropout,以及输出结果中打印的指定 生物统计师 / 医学监查员 / 法规负责人。CLI 标志始终优先于保存的配置;设置 RESEARCH_OPS_NO_CONFIG=1 则完全忽略配置。
七个问题: 开发领域 · alpha · power · 脱落率 · 生物统计师 · 医学监查员 · 法规负责人。
使用 autoresearch 优化(可选)
本技能提供了一个隔离的、可选的桥接接口,可连接至 engineering/autoresearch-agent。只有当您要求“优化”或“运行循环”时,autoresearch 实验才会根据本技能的可行性评分迭代改进研究方案。scripts/ar_evaluator.py 是基准评估器;它会打印 feasibility_composite: <0-100>(分值越高越好)。
/ar:setup --domain custom --name trial-feasibility \
--target study.json \
--eval "python3 ar_evaluator.py --target study.json" \
--metric feasibility_composite --direction higher
/ar:loop custom/trial-feasibility隔离性:无硬性依赖 —— autoresearch 仅在按需时运行,且循环仅修改 study.json,绝不修改评估器(锁定基准)。
参考资料
references/study_design_canon.md— ICH E8(R1) 通用考虑;ICH E9 + E9(R1) 估算量附录;CONSORT 2010;SPIRIT 2013;FDA 多终点指南 (2022)。
references/endpoint_and_power.md— Cohen *Statistical Power Analysis*;Schoenfeld (1983) 生存分析样本量;FDA 替代终点表 / BEST 词汇表;FDA PRO 指南 (2009);Chow, Shao & Wang *Sample Size Calculations in Clinical Research*。
references/trial_operations.md— ICH E6(R2/R3) GCP;TransCelerate 基于风险的监查;FDA RBM 指南;CTTI 招募最佳实践;中心可行性评分文献。
假设
假设条件- 样本量计算公式使用内置 z 表的正态近似。这些结果仅为初步估算;最终的论证由生物统计学家完成(可能会使用模拟、自适应设计或精确方法)。
- 终点评分器通过
--profile根据开发领域应用*惯常的*监管先验值。公司或特定适应症的先例将覆盖该先验值。
- 阶段门(phase-gate)评分器内置了每例患者成本的基准配置文件;可通过传入实际预算来覆盖默认值。
- 未经验证的替代指标不能作为主要终点 —— 评分器将通过扣分来强制执行此规则。
反模式
- 将功效估算视为事实。 所有输出均为估算值,必须由指定的负责人签字确认。
- 基于“方便”的效应量来计算功效。 效应量必须追溯至已发表的或基于锚定的 MCID(最小临床重要差异),而非基于你能负担的样本量 $n$。
- 将主要终点锚定在未经验证的替代指标上。 替代终点需要针对该适应症提供验证证据。
- 忽略多重性。 超过一个主要终点时,需要预先指定 alpha 分配。
- 跳过脱落率补偿。 原始 $n$ 会导致研究样本量不足;应按 $1/(1 - \text{dropout})$ 进行扩充。
区别于
| 相关/邻近团队 | 范围 | 区别 |
|---|---|---|
| ra-qm-team | ISO 13485 QMS, ISO 14971 风险, EU MDR 技术文档 + 临床评估, FDA 510(k)/PMA/De Novo/QSR 提交 | 那是提交申请;临床研究负责提前设计研究 |
| research/grants | NIH 资金申请、探索 + 定位 | 那是寻找资金;这是设计试验 |
| product-team/experiment-designer | 线上产品 A/B 假设 + 样本量 | 那是产品实验;这是临床试验 |
| research-finance (兄弟团队) | 研发项目预算 + 资金消耗 | 那是为项目提供资金;这是确定研究规模 |
快速示例
python3 scripts/sample_size_estimator.py --sample
python3 scripts/sample_size_estimator.py --design proportions --p1 0.30 --p2 0.45 --dropout 0.15
python3 scripts/endpoint_selector.py --sample
python3 scripts/phase_gate_scorer.py --sample --output json示例正确地将未经验证的血清细胞因子替代指标标记为(不能作为主要终点),并将 PASI-75 排为主要终点;阶段门示例返回的裁定结果包含指定的负责人链。
强制性问题库 (Matt Pocock 质询法)
由 /cs:grill-research-ops 或编排器逐一引导。每个问题附带推荐答案 + 权威引用。严禁打包提问。
1. “你的主要终点是临床结局还是替代指标 —— 如果是替代指标,它是否在 FDA 的验证表中?”
推荐答案:除非替代指标在该适应症中已获验证,否则应为临床结局。
权威引用:FDA 替代终点表;BEST (Biomarkers, EndpointS, and other Tools) 词汇表。
2. “你计算功效时采用的最小临床重要差异 (MCID) 是多少 —— 这个数字从何而来?”
推荐答案:引用已发表的或基于锚定的 MCID;绝不能使用方便的效应量。
权威引用:ICH E9; Cohen $\textit{Statistical Power Analysis}$。
3. “你假设的脱落率是多少,样本量是否已据此扩充?”
推荐答案:使用合理的脱落率,将 $n$ 扩充 $1/(1 - \text{dropout})$。
权威引用:Chow, Shao & Wang; ICH E9(R1)。
4. “是单一主要终点还是多个 —— 如果是多个,如何控制多重性?”
推荐答案:预先指定 alpha 分配(层级法 / Bonferroni 法)。
权威引用:FDA 多重终点指南
(2022)。
5. “签署本概要的指定生物统计学家 / 医学监查员 / 监管负责人是谁?”
建议:现在就指明姓名 —— 此输出为建议,而非方案。
标准:ICH E6(R2) GCP 角色与职责。
按深度优先顺序执行。在开启 3-5 之前,先锁定 1-2。所有问题回答完毕后,调用 endpoint_selector.py → sample_size_estimator.py → phase_gate_scorer.py。