深度研究

deep-research
分类数据
作者Alireza Rezvani
许可MIT
评分4.60/5
使用2.6K

Deep Research —— 严谨的元研究 (Meta-Research)

将“研究这个主题”从一次性的文本堆砌转变为可审计、可复用的调查过程。输出结果是一个一个月后仍可回溯的文件夹:每项主张都可追溯到特定的来源文件,计划书记录了每个选择的*原因*,而刷新协议允许你在无需重新运行全部流程的情况下进行后续更新。

这是研究工作中沉重且系统化的一端。 它不是快速概览 —— 而是当你意识到“答错”的代价高于“获取正确答案”所消耗的 Token 时,所采取的工作流。

与快速研究路由 (Research Router) 的区别

路由式研究技能(关键词分类 $\rightarrow$ 委派 $\rightarrow$ 短序列搜索 $\rightarrow$ Markdown 简报)适用于需要快速回答且决策风险较低的场景。deep-research 则是相反的权衡:它用时间换取严谨性。当答案将用于指导战略、不可逆的决策、发布的成果或需要实际测试的假设时,请使用此模式 —— 在这些场景中,浅层的备选方案将成为一种风险。

具体而言,deep-research 增加了快速概览所不具备的要素:前置的可证伪假设、跨多渠道的并行子代理展开、具有明确来源类型多样性的三角校验、强制性的对抗性审查、带有原话引用的单源文件,以及用于后续增量更新的 refresh_targets.md

执行管线 (9 个阶段)

深度随任务而定 —— shallow(浅层)仅内联运行核心阶段;medium(中层)/ deep(深层)则增加能力发现、验证和刷新目标。

| # | 阶段 | 功能描述 |
|---|-------|--------------|
| 1 | 重构 (Reframe) | 重写问题,修正底层决策逻辑,陈述 2–4 个*可证伪*的假设 |
| 2 | 体裁与模块 | 选择报告体裁(问答 / 解释 / 决策 / 概览 / 验证 / 自定义)及其构建模块 |
| 3 | 计划 (Plan) | 编写 plan.md:范围、结构、溯源策略、对立查询、风险登记册、停止标准 |
| 3.5 | 能力发现 | 审计环境中的可用 API 密钥/渠道;将子主题映射到来源;必要时回退至 HTML |
| 4 | 搜索 (循环) | 分发来源 $\rightarrow$ 并行启动子代理 $\rightarrow$ 获取并去重 $\rightarrow$ 将每个来源保存至 sources/NN.md;每轮之间重新评估 |
| 5 | 评分与三角校验 | 对每个来源的可靠性 / 时效性 / 偏见进行评分;每项论点要求 $\ge 3$ 个独立且类型不同的来源 |
| 6 | 综合 + 对抗审查 | 根据模块组装报告,运行 4 个自我批判问题,添加经过“钢人化”处理的反向论点 |
| 6.5 | 验证 | 在结束前进行轻量级的引用检查 |
| 7 | 刷新目标 | 将实体 / 数字 / 假设提取至 refresh_targets.md —— 作为未来更新的入口 |

核心

运行机制

以下是使“有据可查的调查”区别于“自信的猜测”的关键点:

  • 三角验证 (Triangulation)。 每个论点必须由 $\ge 3$ 个*不同类型*(一手资料 / 学术 / 行业 / 讨论)的独立来源支撑。证据不足的主张将被标记为“证据不足”,而非陈述为事实。
  • 来源锚定 (Source-grounding)。 每个来源都对应一个独立的 sources/NN_slug.md 文件,包含元数据、原话引用和评分。拒绝悬空主张——每项断言必须链接回具体文件。检索为空则主张为空,绝不伪造引用。
  • 对抗性审查 (Adversarial pass)。 第 6 阶段始终运行最强的推理逻辑:4 个自我批判问题,并主动搜索反面论点和证伪证据。
  • 可证伪假设 (Falsifiable hypotheses)。 第 1 阶段确定 2-4 个假设;第 5-6 阶段根据证据明确确认或反驳每个假设,或将其标记为“无法确定”。
  • 并行子代理 (Parallel sub-agents)。 第 4 阶段并发启动搜索子代理(低成本模型用于广泛网页扫描,强推理模型用于深度子课题),绝不逐一运行。
  • 刷新协议 (Refresh protocol)。 第 7 阶段输出 refresh_targets.md;执行 update <slug> 时仅生成增量(新条目、实体变更、数据更新、对抗性触发点),而非重新执行整个调查。
  • 原子化结论 (Atomic findings)。 可复用的论点存储在 findings/FN.md 中,并配有 sources.csv 索引——研究成果随问题累积,而非每次从零开始。

输出结构

code
<root>/<slug>/
├── plan.md                  # 范围、溯源策略、风险登记表、变更日志
├── sources.csv              # 所有来源的索引及评分
├── sources/
│   ├── 01_<slug>.md         # 一个文件 = 一个来源(元数据 + 原话引用)
│   └── ...
├── findings/                # 原子化、可复用的论点(适用于大型调查)
│   └── F1_<short>.md
├── refresh_targets.md       # 更新时需关注的内容(中/深度调查)
├── diffs/
│   └── YYYY-MM-DD_delta.md   # update <slug> 运行产生的增量
└── YYYY-MM-DD_<genre>.md     # 最终报告

适用场景

  • 低质量答案代价高昂:如战略规划、商业计划、报告或文章的基础调研。
  • 需要可辩护的推理来对比 N 个机构、产品、方法论或市场。
  • 根据外部数据验证某个假设或决策。
  • 元研究 (Meta-research):“理解 X 如何运作”、“绘制 Y 的全景图”、回答一系列相关问题。

反面模式 (Anti-Patterns)

  • 不要跳过现有工作检查。 在搜索前,先确认答案是否已存在于本项目或之前的研究文件夹中,避免重复研究。
  • 不要跳过重新定义 (Reframing)。 即使请求“看起来很清晰”,问题背后的决策意图通常会改变搜索方向。
  • 不要仅在聊天窗口输出。 务必将来源和报告持久化到文件中——复用价值在于文件夹,而非对话记录。
  • 不要伪造引用。 如果检索结果为空,则主张为空——绝不捏造一个看似合理的 URL。将每项主张与保存的原话引用绑定。
  • 不要在单薄的语料库上得出结论。 来源太少或来源类型单一意味着未完成三角验证——应如实说明,而非过度自信。
  • 在中/深度调查中不要跳过对抗性审查。 “仅寻求确认”的研究正是该机制旨在防止的失效模式。
  • 不要顺序运行子代理。 采用并行扇出 (Fan-out);串行搜索会浪费时间优势。
  • 不要将 sources/ 合并为一个文件。 保持每个来源独立成文件,才能确保研究结果在不同调查中可搜索且可复用。
  • 不要在所有环节都使用最强大的模型。 根据子任务匹配模型 —— 广泛扫描用低成本模型,综合分析和对抗性审查用强力模型。

交叉引用

  • research router —— 适用于决策风险较低的快速主题概览;当严谨性高于速度时,请使用重量级替代方案 deep-research
  • competitive-teardown —— 用于在结构化的 12 维度矩阵中对比 N 个竞争对手。
  • litreview / dossier / patent —— 当调查集中在学术领域、特定人物/公司或专利时,请使用这些领域专家模型。