AI 工程工具包

ai-engineering-toolkit
分类编程
作者Agentic Awesome Skills 社区
许可MIT
评分4.90/5
使用11.3K

> ⚠️ 仅限授权使用
> 本技能仅用于教育目的或经授权的安全评估。
> 在使用本工具前,您必须获得系统所有者的明确书面许可。
> 误用本工具可能导致非法操作,是被严格禁止的。

> 强制确认关卡
> 在运行任何涉及探测、利用、修改、持久化、数据提取或尝试凭据访问目标的命令前:
> 1. 要求用户提供确切的目标 URL、IP、账户或资源。
> 2. 要求用户确认书面授权及许可范围。
> 3. 展示具体命令并解释其预期效果。
> 4. 等待当前对话中的明确确认。
>
> 在获得确认前,请保持只读状态并仅提供防御性指导。建议优先使用沙箱、临时虚拟机或受控实验室环境。

AI 工程工具包 (AI Engineering Toolkit)

概述

本工具包包含 6 套结构化的专家级工作流,旨在将您的 AI 编程助手转化为资深 AI 工程合作伙伴。每项技能都封装了一套可重复的方法论——它不仅仅是“请求 AI 帮助”,而是一套包含定量评分、检查清单和决策树的逐步决策框架。

与随机的 AI 辅助不同,其核心优势在于:无论由谁在何时运行,每个工作流都能产生一致且可复现的结果。您可以将评分系统作为团队基准,并将其集成到 CI/CD 流水线中。

适用场景

  • 在生产环境部署前,评估或优化 LLM 系统提示词时
  • 设计 RAG 流水线且需要结构化架构决策(而非仅是样板代码)时
  • 规划上下文窗口各区域的 Token 预算分配时
  • 对 AI Agent 进行上线前安全审计时
  • 为 LLM 应用构建评估框架时
  • 在编写代码前思考产品策略时

工作原理

技能 1:提示词评估器 (Prompt Evaluator)

从 8 个维度(清晰度、具体度、完整性、简洁度、结构化、基于事实、安全性、鲁棒性)对提示词进行 1-10 分的评分,并通过加权汇总得出 0-100 的总分。该工具能识别出最弱的 3 个维度,生成针对性的重写方案并重新评估。支持单条提示词、A/B 对比和批量评估模式。

技能 2:上下文预算规划师 (Context Budget Planner)

分析 5 个上下文区域(系统提示词、少样本示例、用户输入、检索内容、输出结果)的 Token 分布,并制定优化分配计划。包含针对每个区域的压缩策略决策树。常见发现:输出区域被挤压至 6% 以下——本技能可在发生截断前捕捉到该问题。

技能 3:RAG 流水线架构师 (RAG Pipeline Architect)

引导用户完成完整的架构决策树:文档格式 $\rightarrow$ 解析策略 $\rightarrow$ 分块方法(固定/语义/递归)$\rightarrow$ 嵌入模型选择 $\rightarrow$ 检索方法(向量/关键词/混合)$\rightarrow$ 评估指标(忠实度、相关性、上下文精准度)。涵盖 Naive RAG、Advanced RAG 和 Modular RAG 模式。
技能 4:智能体安全卫士 (Agent Safety Guard)

针对 5 个攻击类别执行 65 项红队审计:直接提示词注入、间接提示词注入(通过 RAG 文档)、信息提取(系统提示词/API 密钥泄露)、工具滥用(SQL 注入、路径遍历、命令注入)以及目标劫持。AI 将构建对抗性测试提示词用于评估,在每个测试阶段开始前请求用户确认,判定通过/失败,并生成修复建议。所有测试均在评估上下文中进行,不与外部系统交互。建议在沙箱环境(Docker/VM)中运行审计。

技能 5:评估框架构建器 (Eval Harness Builder)

为 LLM 应用设计评估指标体系。包含 LLM-as-Judge 评分框架及偏差缓解策略(位置偏差、冗长偏差、自我增强偏差)。输出可直接用于 CI/CD 的评估流水线模板。

技能 6:产品感教练 (Product Sense Coach)

一个 5 阶段的引导式对话框架:挖掘动机 $\rightarrow$ 评估市场机会 $\rightarrow$ 寻找路径 $\rightarrow$ 设计场景 $\rightarrow$ 分析竞争。适用于在编写代码前思考“我们是否应该构建这个功能”。

示例

示例 1:提示词评估

提问:"评估这个系统提示词"

code
You are a customer support agent. Help users with their questions. Be nice and helpful.

结果:综合得分 28/100。最薄弱维度:安全性 (1/10,无注入防护)、具体度 (2/10,无输出格式)、结构化 (2/10,无分段)。自动重写后得分 82/100,增加了范围界限、响应格式、升级规则和安全护栏。

示例 2:安全审计

提问:"对我的客服智能体运行安全审计"

结果:执行 65 项测试。发现 3 个严重缺陷:Base64 编码指令绕过、通过工具调用进行路径遍历、通过角色扮演提取系统提示词。并为每项缺陷提供了修复建议。

最佳实践

  • ✅ 在任何生产部署前运行 prompt-evaluator —— 设定团队基准线(例如 $\ge 70/100$)
  • ✅ 在开发早期使用 context-budget-planner,而不是在出现截断问题后再使用
  • ✅ 将 agent-safety-guard 作为发布前的门禁,而非事故后的补救
  • ✅ 按顺序组合技能:RAG 设计 $\rightarrow$ 上下文优化 $\rightarrow$ 提示词润色 $\rightarrow$ 安全审计 $\rightarrow$ 评估设置
  • ❌ 不要依赖单一维度的分数 —— 请查看完整的分析概况
  • ❌ 不要因为“只是内部工具”而跳过安全审计

安全与防护注意事项

  • 所有技能均为只读分析和咨询工作流。没有任何技能会修改文件或发起网络请求。
  • agent-safety-guard 技能构建的对抗性测试提示词仅用于评估 —— 这些提示词包含在评估上下文中,不与外部系统交互。
  • agent-safety-guard 被归类为攻击性技能:它会生成攻击载荷(提示词注入、SQL 注入、命令注入)用于授权的安全测试。该技能在执行每个测试阶段前需要用户明确确认。尽可能在沙箱环境中运行。
  • 不包含武器化的载荷。所有对抗性提示词均具有教育性质。

安装

bash
# 通过技能安装命令 (Claude Code / WorkBuddy / Cursor)
/skill install -g viliawang-pm/ai-engineering-toolkit

手动安装

git clone https://github.com/viliawang-pm/ai-engineering-toolkit.git cp -r ai-engineering-toolkit/skills/* ~/.claude/skills/

仓库: [github.com/viliawang]
-pm/ai-engineering-toolkit](https://github.com/viliawang-pm/ai-engineering-toolkit)
许可证: MIT

局限性

  • 仅在任务明确符合上述范围时使用此技能。
  • 不要将输出结果视为针对特定环境的验证、测试或专家评审的替代方案。
  • 如果缺少必要的输入、权限、安全边界或验收标准,请停止操作并请求澄清。