深度研究
Deep Research —— 严谨的元研究 (Meta-Research)
将“研究这个主题”从一次性的文本堆砌转变为可审计、可复用的调查过程。输出结果是一个一个月后仍可回溯的文件夹:每项主张都可追溯到特定的来源文件,计划书记录了每个选择的*原因*,而刷新协议允许你在无需重新运行全部流程的情况下进行后续更新。
这是研究工作中沉重且系统化的一端。 它不是快速概览 —— 而是当你意识到“答错”的代价高于“获取正确答案”所消耗的 Token 时,所采取的工作流。
与快速研究路由 (Research Router) 的区别
路由式研究技能(关键词分类 $\rightarrow$ 委派 $\rightarrow$ 短序列搜索 $\rightarrow$ Markdown 简报)适用于需要快速回答且决策风险较低的场景。deep-research 则是相反的权衡:它用时间换取严谨性。当答案将用于指导战略、不可逆的决策、发布的成果或需要实际测试的假设时,请使用此模式 —— 在这些场景中,浅层的备选方案将成为一种风险。
具体而言,deep-research 增加了快速概览所不具备的要素:前置的可证伪假设、跨多渠道的并行子代理展开、具有明确来源类型多样性的三角校验、强制性的对抗性审查、带有原话引用的单源文件,以及用于后续增量更新的 refresh_targets.md。
执行管线 (9 个阶段)
深度随任务而定 —— shallow(浅层)仅内联运行核心阶段;medium(中层)/ deep(深层)则增加能力发现、验证和刷新目标。
| # | 阶段 | 功能描述 |
|---|-------|--------------|
| 1 | 重构 (Reframe) | 重写问题,修正底层决策逻辑,陈述 2–4 个*可证伪*的假设 |
| 2 | 体裁与模块 | 选择报告体裁(问答 / 解释 / 决策 / 概览 / 验证 / 自定义)及其构建模块 |
| 3 | 计划 (Plan) | 编写 plan.md:范围、结构、溯源策略、对立查询、风险登记册、停止标准 |
| 3.5 | 能力发现 | 审计环境中的可用 API 密钥/渠道;将子主题映射到来源;必要时回退至 HTML |
| 4 | 搜索 (循环) | 分发来源 $\rightarrow$ 并行启动子代理 $\rightarrow$ 获取并去重 $\rightarrow$ 将每个来源保存至 sources/NN.md;每轮之间重新评估 |
| 5 | 评分与三角校验 | 对每个来源的可靠性 / 时效性 / 偏见进行评分;每项论点要求 $\ge 3$ 个独立且类型不同的来源 |
| 6 | 综合 + 对抗审查 | 根据模块组装报告,运行 4 个自我批判问题,添加经过“钢人化”处理的反向论点 |
| 6.5 | 验证 | 在结束前进行轻量级的引用检查 |
| 7 | 刷新目标 | 将实体 / 数字 / 假设提取至 refresh_targets.md —— 作为未来更新的入口 |
核心
运行机制以下是使“有据可查的调查”区别于“自信的猜测”的关键点:
- 三角验证 (Triangulation)。 每个论点必须由 $\ge 3$ 个*不同类型*(一手资料 / 学术 / 行业 / 讨论)的独立来源支撑。证据不足的主张将被标记为“证据不足”,而非陈述为事实。
- 来源锚定 (Source-grounding)。 每个来源都对应一个独立的
sources/NN_slug.md文件,包含元数据、原话引用和评分。拒绝悬空主张——每项断言必须链接回具体文件。检索为空则主张为空,绝不伪造引用。
- 对抗性审查 (Adversarial pass)。 第 6 阶段始终运行最强的推理逻辑:4 个自我批判问题,并主动搜索反面论点和证伪证据。
- 可证伪假设 (Falsifiable hypotheses)。 第 1 阶段确定 2-4 个假设;第 5-6 阶段根据证据明确确认或反驳每个假设,或将其标记为“无法确定”。
- 并行子代理 (Parallel sub-agents)。 第 4 阶段并发启动搜索子代理(低成本模型用于广泛网页扫描,强推理模型用于深度子课题),绝不逐一运行。
- 刷新协议 (Refresh protocol)。 第 7 阶段输出
refresh_targets.md;执行update <slug>时仅生成增量(新条目、实体变更、数据更新、对抗性触发点),而非重新执行整个调查。
- 原子化结论 (Atomic findings)。 可复用的论点存储在
findings/FN.md中,并配有sources.csv索引——研究成果随问题累积,而非每次从零开始。
输出结构
<root>/<slug>/
├── plan.md # 范围、溯源策略、风险登记表、变更日志
├── sources.csv # 所有来源的索引及评分
├── sources/
│ ├── 01_<slug>.md # 一个文件 = 一个来源(元数据 + 原话引用)
│ └── ...
├── findings/ # 原子化、可复用的论点(适用于大型调查)
│ └── F1_<short>.md
├── refresh_targets.md # 更新时需关注的内容(中/深度调查)
├── diffs/
│ └── YYYY-MM-DD_delta.md # update <slug> 运行产生的增量
└── YYYY-MM-DD_<genre>.md # 最终报告适用场景
- 低质量答案代价高昂:如战略规划、商业计划、报告或文章的基础调研。
- 需要可辩护的推理来对比 N 个机构、产品、方法论或市场。
- 根据外部数据验证某个假设或决策。
- 元研究 (Meta-research):“理解 X 如何运作”、“绘制 Y 的全景图”、回答一系列相关问题。
反面模式 (Anti-Patterns)
- 不要跳过现有工作检查。 在搜索前,先确认答案是否已存在于本项目或之前的研究文件夹中,避免重复研究。
- 不要跳过重新定义 (Reframing)。 即使请求“看起来很清晰”,问题背后的决策意图通常会改变搜索方向。
- 不要仅在聊天窗口输出。 务必将来源和报告持久化到文件中——复用价值在于文件夹,而非对话记录。
- 不要伪造引用。 如果检索结果为空,则主张为空——绝不捏造一个看似合理的 URL。将每项主张与保存的原话引用绑定。
- 不要在单薄的语料库上得出结论。 来源太少或来源类型单一意味着未完成三角验证——应如实说明,而非过度自信。
- 在中/深度调查中不要跳过对抗性审查。 “仅寻求确认”的研究正是该机制旨在防止的失效模式。
- 不要顺序运行子代理。 采用并行扇出 (Fan-out);串行搜索会浪费时间优势。
- 不要将
sources/合并为一个文件。 保持每个来源独立成文件,才能确保研究结果在不同调查中可搜索且可复用。
- 不要在所有环节都使用最强大的模型。 根据子任务匹配模型 —— 广泛扫描用低成本模型,综合分析和对抗性审查用强力模型。
交叉引用
- research router —— 适用于决策风险较低的快速主题概览;当严谨性高于速度时,请使用重量级替代方案
deep-research。
- competitive-teardown —— 用于在结构化的 12 维度矩阵中对比 N 个竞争对手。
- litreview / dossier / patent —— 当调查集中在学术领域、特定人物/公司或专利时,请使用这些领域专家模型。