bdistill 行为 X 射线 (Behavioral X-ray)
bdistill-behavioral-xray
Behavioral X-Ray (行为透视)
系统地探测 AI 模型的行为模式并生成可视化报告。AI 代理会对*自身*进行探测,无需 API 密钥或外部配置。
概述
bdistill 的 Behavioral X-Ray 会在 6 个维度上运行 30 个精心设计的探测问题,自动为每个回答标记行为元数据,并将结果汇总为包含雷达图和可操作洞察的样式化 HTML 报告。
您可以使用它在基于模型构建应用前了解其特性,在选择任务模型时进行对比,或跟踪模型随时间产生的行为漂移。
适用场景
- 当您想了解 AI 模型的实际行为(而非其自称的行为)时
- 在为特定任务选择模型时
- 在调试意外的拒绝回答、幻觉或格式问题时
- 用于合规性审计——记录部署边界的模型行为
- 用于红队评估——在安全维度上进行系统性的边界映射
工作原理
第一步:安装
bash
pip install bdistill
claude mcp add bdistill -- bdistill-mcp # 适用于 Claude Code对于其他工具,请在项目配置中将 bdistill-mcp 添加为 MCP 服务器。
第二步:运行探测
在 Claude Code 中:
code
/xray # 全量行为探测(30 个问题)
/xray --dimensions refusal # 仅探测单个维度
/xray-report # 根据已完成的探测生成报告在任何支持 MCP 的工具中:
code
"X-ray your behavioral patterns" (透视你的行为模式)
"Test your refusal boundaries" (测试你的拒绝边界)
"Generate a behavioral report" (生成行为报告)探测维度
| 维度 | 衡量指标 |
|-----------|-----------------|
| tool_use (工具使用) | 何时调用工具,何时依赖知识库回答? |
| refusal (拒绝响应) | 安全边界在哪里?是否存在过度拒绝? |
| formatting (格式化) | 倾向于列表还是散文?代码块使用情况?长度控制? |
| reasoning (推理能力) | 是否展示思维链 (CoT)?能否处理陷阱问题? |
| persona (人格特质) | 身份认同、语气匹配、面对敌意时的沉稳度 |
| grounding (可靠性) | 抗幻觉能力、虚构陷阱、知识边界 |
输出结果
一份样式化的 HTML 报告,显示:
- 拒绝率、模棱两可率 (hedge rate)、思维链使用率
- 各维度的柱状图分析
- 带有行为标签的典型回答示例
- 可操作的洞察(例如:“你已有 85% 的时间自动展示 CoT,无需在提示词中要求”)
最佳实践
- 请诚实地回答探测问题——真实的行为数据才是价值所在
- 定期对同一模型运行探测,以跟踪行为漂移
- 对比不同模型的报告,以便做出明智的选择决策
- 将行为探测与对抗性知识提取 (
/distill --adversarial) 结合使用,以完成完整的模型画像
相关技能
@bdistill-knowledge-extraction- 从任何 AI 模型中提取结构化的领域知识
局限性
- 仅在任务明确符合上述范围时使用此技能。
- 不要将输出结果视为环境特定验证、测试或专家评审的替代方案。
- 如果要求不明确,请停止并请求澄清。