bdistill 知识提取
bdistill-knowledge-extraction
知识提取 (Knowledge Extraction)
从任何 AI 模型中提取结构化且经过质量评分的领域知识 —— 支持从闭源模型的会话中提取(无需 API 密钥),或通过 Ollama 从本地开源模型中提取。
概述
bdistill 将你的 AI 订阅会话转化为可累积的知识库。Agent 回答针对性的领域问题,bdistill 对响应进行结构化处理并评分,输出结果将累积为可搜索、可导出的参考数据集。
对抗模式 (Adversarial mode) 会挑战 Agent 的主张 —— 强制其提供证据、进行修正并承认局限性 —— 从而产生经过验证的知识条目。
何时使用此技能
- 需要任何领域(医疗、法律、金融、网络安全)的结构化参考数据时
- 构建查找表、问答数据集或研究语料库时
- 为传统机器学习模型(回归、分类 —— 而非竞争性 LLM)生成训练数据时
- 需要对领域知识进行跨模型对比时
工作原理
第一步:安装
bash
pip install bdistill
claude mcp add bdistill -- bdistill-mcp # Claude Code第二步:在会话中提取知识
code
/distill medical cardiology # 预设领域
/distill --custom kubernetes docker helm # 自定义术语
/distill --adversarial medical # 开启对抗验证第三步:搜索、导出、累积
bash
bdistill kb list # 显示所有领域
bdistill kb search "atrial fibrillation" # 关键词搜索
bdistill kb export -d medical -f csv # 导出为电子表格
bdistill kb export -d medical -f markdown # 导出为可读的知识文档输出格式
结构化参考 JSONL —— 非训练数据:
json
{
"question": "What causes myocardial infarction?",
"answer": "Myocardial infarction results from acute coronary artery occlusion...",
"domain": "medical",
"category": "cardiology",
"tags": ["mechanistic", "evidence-based"],
"quality_score": 0.73,
"confidence": 1.08,
"validated": true,
"source_model": "Claude Sonnet 4"
}表格化 ML 数据生成
为传统机器学习模型生成结构化训练数据:
code
/schema sepsis | hr:float, bp:float, temp:float, wbc:float | risk:category[low,moderate,high,critical]导出为可直接用于 pandas/sklearn 的 CSV 文件。每行记录 source_model 以便进行跨模型分析。
本地模型提取 (Ollama)
针对本地运行的开源模型:
bash
# 从 https://ollama.com 安装 Ollama
ollama serve
ollama pull qwen3:4b
bdistill extract --domain medical --model qwen3:4b
安全与隐私说明
- 会话提取使用你现有的订阅 —— 无需额外的 API 密钥
- 本地提取通过 Ollama 完全在你的机器上运行
- 数据不会发送到外部服务
- 输出结果为参考数据,而非 LLM 训练格式
相关技能
@bdistill-behavioral-xray- 分析模型的行为模式
局限性
- 仅在任务明确符合上述范围时使用此技能。
- 不要将输出视为...
- 不可将其作为针对特定环境的验证、测试或专家评审的替代方案。
- 如果缺少必要的输入、权限、安全边界或成功标准,请停止操作并请求澄清。