bdistill 知识提取

bdistill-knowledge-extraction
分类编程
作者Agentic Awesome Skills 社区
许可MIT
评分4.40/5
使用7.6K

知识提取 (Knowledge Extraction)

从任何 AI 模型中提取结构化且经过质量评分的领域知识 —— 支持从闭源模型的会话中提取(无需 API 密钥),或通过 Ollama 从本地开源模型中提取。

概述

bdistill 将你的 AI 订阅会话转化为可累积的知识库。Agent 回答针对性的领域问题,bdistill 对响应进行结构化处理并评分,输出结果将累积为可搜索、可导出的参考数据集。

对抗模式 (Adversarial mode) 会挑战 Agent 的主张 —— 强制其提供证据、进行修正并承认局限性 —— 从而产生经过验证的知识条目。

何时使用此技能

  • 需要任何领域(医疗、法律、金融、网络安全)的结构化参考数据时
  • 构建查找表、问答数据集或研究语料库时
  • 为传统机器学习模型(回归、分类 —— 而非竞争性 LLM)生成训练数据时
  • 需要对领域知识进行跨模型对比时

工作原理

第一步:安装

bash
pip install bdistill
claude mcp add bdistill -- bdistill-mcp   # Claude Code

第二步:在会话中提取知识

code
/distill medical cardiology                    # 预设领域
/distill --custom kubernetes docker helm       # 自定义术语
/distill --adversarial medical                 # 开启对抗验证

第三步:搜索、导出、累积

bash
bdistill kb list                               # 显示所有领域
bdistill kb search "atrial fibrillation"       # 关键词搜索
bdistill kb export -d medical -f csv           # 导出为电子表格
bdistill kb export -d medical -f markdown      # 导出为可读的知识文档

输出格式

结构化参考 JSONL —— 非训练数据:

json
{
  "question": "What causes myocardial infarction?",
  "answer": "Myocardial infarction results from acute coronary artery occlusion...",
  "domain": "medical",
  "category": "cardiology",
  "tags": ["mechanistic", "evidence-based"],
  "quality_score": 0.73,
  "confidence": 1.08,
  "validated": true,
  "source_model": "Claude Sonnet 4"
}

表格化 ML 数据生成

为传统机器学习模型生成结构化训练数据:

code
/schema sepsis | hr:float, bp:float, temp:float, wbc:float | risk:category[low,moderate,high,critical]

导出为可直接用于 pandas/sklearn 的 CSV 文件。每行记录 source_model 以便进行跨模型分析。

本地模型提取 (Ollama)

针对本地运行的开源模型:

bash
# 从 https://ollama.com 安装 Ollama
ollama serve
ollama pull qwen3:4b

bdistill extract --domain medical --model qwen3:4b

安全与隐私说明

  • 会话提取使用你现有的订阅 —— 无需额外的 API 密钥
  • 本地提取通过 Ollama 完全在你的机器上运行
  • 数据不会发送到外部服务
  • 输出结果为参考数据,而非 LLM 训练格式

相关技能

  • @bdistill-behavioral-xray - 分析模型的行为模式

局限性

  • 仅在任务明确符合上述范围时使用此技能。
  • 不要将输出视为...
  • 不可将其作为针对特定环境的验证、测试或专家评审的替代方案。
  • 如果缺少必要的输入、权限、安全边界或成功标准,请停止操作并请求澄清。