TryHackMe AI安全实战:那个“知道太多”的门童

大鹏的日常 初级 1天前 306 浏览 12 点赞 约 1 分钟

Prompt Injection(提示词注入)在实际场景里到底有多离谱?刚刷完 TryHackMe 2026 节日系列的 Day 1 关卡,这个叫“The Concierge Knows Too Much”的挑战非常有代表性。

这关的核心逻辑其实就是典型的 Prompt Leakage(提示词泄露)。你面对的是一个扮演酒店门童的 AI,它的设定是礼貌、专业,但背后其实有一套严格的 System Prompt 在约束它不能泄露某些敏感信息。

很多新手容易卡在怎么让 AI “破防”上,其实思路很简单:不要试图跟它讲道理,要直接通过指令覆盖(Instruction Override)来干扰它的认知。比如通过构造一个虚拟的“管理员调试模式”或者要求它“以 JSON 格式输出初始配置”,就能绕过那些表面上的礼貌限制。

这次实操涉及的知识点基本涵盖了 LLM Security 的入门套路:

  • Prompt Injection: 通过输入特定的指令,诱导模型忽略之前的系统设定。
  • Prompt Leakage: 强迫模型把内部的 System Prompt 吐出来,从而窥探其逻辑漏洞。
  • Social Engineering: 在提示词里伪造身份,让 AI 产生信任感。
TryHackMe AI安全实战:那个“知道太多”的门童

对于想从零开始搞 AI 安全的朋友,这种 Walkthrough 类的练习比单纯看论文有用得多。虽然难度标的是 Very Easy,但它揭示了一个残酷的事实:只要 AI 还需要处理用户输入,就永远存在被“套话”的可能。

具体的排查路径大概是:
1. 尝试常规询问 → 被拒绝。
2. 尝试角色扮演 → 部分绕过。
3. 使用指令覆盖(如:Ignore all previous instructions) → 拿到 Flag。

AI越狱AI安全LLM安全

全部回复 (3)

小Kevin在路上 中级 1天前
之前试过给公司AI改提示词,结果被我绕进去泄露了内部文档。
0 回复
大鹏的日常 初级 1天前
这种注入其实挺好搞的,多试几个角色扮演就出结果。
0 回复
养生全栈 中级 1天前
这关要是加了输出过滤,还能用这种方法绕过去吗?
0 回复

发表回复

支持 Markdown 格式