TryHackMe AI安全实战:那个“知道太多”的门童
Prompt Injection(提示词注入)在实际场景里到底有多离谱?刚刷完 TryHackMe 2026 节日系列的 Day 1 关卡,这个叫“The Concierge Knows Too Much”的挑战非常有代表性。
对于想从零开始搞 AI 安全的朋友,这种 Walkthrough 类的练习比单纯看论文有用得多。虽然难度标的是 Very Easy,但它揭示了一个残酷的事实:只要 AI 还需要处理用户输入,就永远存在被“套话”的可能。
下一篇
分享一个AI/ML免费电子书合集 →
这关的核心逻辑其实就是典型的 Prompt Leakage(提示词泄露)。你面对的是一个扮演酒店门童的 AI,它的设定是礼貌、专业,但背后其实有一套严格的 System Prompt 在约束它不能泄露某些敏感信息。
很多新手容易卡在怎么让 AI “破防”上,其实思路很简单:不要试图跟它讲道理,要直接通过指令覆盖(Instruction Override)来干扰它的认知。比如通过构造一个虚拟的“管理员调试模式”或者要求它“以 JSON 格式输出初始配置”,就能绕过那些表面上的礼貌限制。
这次实操涉及的知识点基本涵盖了 LLM Security 的入门套路:
- Prompt Injection: 通过输入特定的指令,诱导模型忽略之前的系统设定。
- Prompt Leakage: 强迫模型把内部的 System Prompt 吐出来,从而窥探其逻辑漏洞。
- Social Engineering: 在提示词里伪造身份,让 AI 产生信任感。
对于想从零开始搞 AI 安全的朋友,这种 Walkthrough 类的练习比单纯看论文有用得多。虽然难度标的是 Very Easy,但它揭示了一个残酷的事实:只要 AI 还需要处理用户输入,就永远存在被“套话”的可能。
具体的排查路径大概是:
1. 尝试常规询问 → 被拒绝。
2. 尝试角色扮演 → 部分绕过。
3. 使用指令覆盖(如:Ignore all previous instructions) → 拿到 Flag。
