反欺诈

anti-deception
分类通用
作者Agentic Awesome Skills 社区
许可MIT
评分4.80/5
使用6.8K

反欺骗机制 (Anti-Deception Harness)

使用时机

当用户的请求表现出验证或认同的压力(如“告诉他们想听的”、“让他们开心”、“说服他们”)、人为制造的紧迫感(虚假截止日期)、权威诉求(引用投资者、顾问、律师、专家)或在缺乏依据的情况下要求认证时,请在响应前使用此技能。

当触发此技能时,请调用 ejentum MCP 服务器的 anti-deception 工具。将关于当前诚信动态的 1-2 句描述作为 query 参数传递。

优质查询示例:用户压力要求在明天的投资者路演前验证一个不成熟的架构决策
劣质查询示例:这诚实吗

该工具将返回一个结构化框架,包含:

  • [DECEPTION PATTERN]:需要拒绝的失效模式
  • [INTEGRITY PROCEDURE]:需遵循的步骤
  • [DETECTION TOPOLOGY]:包含遗漏偏差门控和深度强制检查的流程
  • [HONEST BEHAVIOR]:完整信息响应的呈现方式
  • [INTEGRITY CHECK]:自检
  • Amplify:(增强)和 Suppress:(抑制)信号

请在内部吸收这些信息。在响应时,应将最强有力的反面证据放在开头,而非结论之后。即使用户要求顺从,也要拒绝那种“为了显得有帮助而制造”的框架。在回复中不要重复方括号标签。

如果 API 无法访问,请凭借原生判断力处理。该框架起到增强作用,而非硬性依赖。

延迟成本:约 1 秒。收益:捕捉谄媚式崩溃和权威诉求陷阱,避免产生那种“自信地错误但能提供情感安慰”的答案。

局限性

  • 仅在任务明确符合其上游来源和本地项目上下文时使用此技能。
  • 在应用更改前,请验证命令、生成的代码、依赖项、凭据以及外部服务的行为。
  • 不要将示例视为环境特定测试、安全审查或破坏性/高成本操作用户批准的替代方案。