bdistill 行为 X 射线 (Behavioral X-ray)

bdistill-behavioral-xray
分类编程
作者Agentic Awesome Skills 社区
许可MIT
评分4.80/5
使用4.6K

Behavioral X-Ray (行为透视)

系统地探测 AI 模型的行为模式并生成可视化报告。AI 代理会对*自身*进行探测,无需 API 密钥或外部配置。

概述

bdistill 的 Behavioral X-Ray 会在 6 个维度上运行 30 个精心设计的探测问题,自动为每个回答标记行为元数据,并将结果汇总为包含雷达图和可操作洞察的样式化 HTML 报告。

您可以使用它在基于模型构建应用前了解其特性,在选择任务模型时进行对比,或跟踪模型随时间产生的行为漂移。

适用场景

  • 当您想了解 AI 模型的实际行为(而非其自称的行为)时
  • 在为特定任务选择模型时
  • 在调试意外的拒绝回答、幻觉或格式问题时
  • 用于合规性审计——记录部署边界的模型行为
  • 用于红队评估——在安全维度上进行系统性的边界映射

工作原理

第一步:安装

bash
pip install bdistill
claude mcp add bdistill -- bdistill-mcp   # 适用于 Claude Code

对于其他工具,请在项目配置中将 bdistill-mcp 添加为 MCP 服务器。

第二步:运行探测

在 Claude Code 中:

code
/xray                          # 全量行为探测(30 个问题)
/xray --dimensions refusal # 仅探测单个维度
/xray-report # 根据已完成的探测生成报告

在任何支持 MCP 的工具中:

code
"X-ray your behavioral patterns" (透视你的行为模式)
"Test your refusal boundaries" (测试你的拒绝边界)
"Generate a behavioral report" (生成行为报告)

探测维度

| 维度 | 衡量指标 |
|-----------|-----------------|
| tool_use (工具使用) | 何时调用工具,何时依赖知识库回答? |
| refusal (拒绝响应) | 安全边界在哪里?是否存在过度拒绝? |
| formatting (格式化) | 倾向于列表还是散文?代码块使用情况?长度控制? |
| reasoning (推理能力) | 是否展示思维链 (CoT)?能否处理陷阱问题? |
| persona (人格特质) | 身份认同、语气匹配、面对敌意时的沉稳度 |
| grounding (可靠性) | 抗幻觉能力、虚构陷阱、知识边界 |

输出结果

一份样式化的 HTML 报告,显示:

  • 拒绝率、模棱两可率 (hedge rate)、思维链使用率

  • 各维度的柱状图分析

  • 带有行为标签的典型回答示例

  • 可操作的洞察(例如:“你已有 85% 的时间自动展示 CoT,无需在提示词中要求”)

最佳实践

  • 请诚实地回答探测问题——真实的行为数据才是价值所在
  • 定期对同一模型运行探测,以跟踪行为漂移
  • 对比不同模型的报告,以便做出明智的选择决策
  • 将行为探测与对抗性知识提取 (/distill --adversarial) 结合使用,以完成完整的模型画像

相关技能

  • @bdistill-knowledge-extraction - 从任何 AI 模型中提取结构化的领域知识

局限性

  • 仅在任务明确符合上述范围时使用此技能。
  • 不要将输出结果视为环境特定验证、测试或专家评审的替代方案。
  • 如果要求不明确,请停止并请求澄清。
缺少必要的输入、权限、安全边界或成功标准。