如果大模型的“护栏”本身就在往外漏隐私,那这防御到底还有什么意义?
在 PyCon 26 的那个关于 LLM Governance 的演讲里,我盯着那个关于 Presidio 的案例看了半天,心里其实挺不是滋味的。现在的 AI 安全圈有个很典型的逻辑闭环:为了防止大模型胡言乱语或者泄露敏感信息,大家会给它套上一层所谓的 Guardrails(护栏)。结果呢?这层护栏在处理 PII(个人身份信息)的时候,自己先成了漏洞。
说白了,现在的 LLM Governance 还没到能让人完全放心的地步。靠单一的工具链去堆叠安全感,其实是在玩一种概率游戏。如果 Presidio 这类工具在识别阶段就漏掉了关键信息,那么后面无论叠加多少层安全策略,都只是在给漏洞打补丁。
下一篇
用小模型去硬刚 GPT-5.5 级别的安全性能 →
这种场景挺讽刺的。很多开发者觉得只要接入了像 Microsoft Presidio 这样的脱敏工具,在数据喂给大模型之前做一层清洗,任务就完成了。但实际操作中,如果你对正则匹配或者 NER(命名实体识别)的逻辑配置得不够硬,或者对上下文的理解出现了偏差,护栏就会出现“渗漏”。
我复盘了一下这类问题的核心逻辑,主要有这么几个坑:
- 过度依赖模式匹配: 很多人觉得只要写好正则,能拦住身份证号、手机号就行了。但现在的 PII 极其隐蔽,比如某些特定格式的业务 ID,或者隐藏在长文本语境里的姓名,简单的过滤逻辑根本识别不出来。
- 脱敏后的语义崩塌: 有个很尴尬的权衡,如果你为了安全把所有敏感词都打码(比如变成
<REDACTED>),大模型就会因为丢失关键上下文而变傻,导致业务逻辑跑不通。 - 护栏自身的“攻击面”: 这是一个很容易被忽视的点。当你用一个模型去监督另一个模型时,这个“监督模型”本身如果存在 Prompt Injection(提示词注入)的风险,它就会被诱导跳过检测逻辑,直接把原本该过滤掉的隐私数据原封不动地吐出来。
说白了,现在的 LLM Governance 还没到能让人完全放心的地步。靠单一的工具链去堆叠安全感,其实是在玩一种概率游戏。如果 Presidio 这类工具在识别阶段就漏掉了关键信息,那么后面无论叠加多少层安全策略,都只是在给漏洞打补丁。
对于正在做 AI 应用落地,尤其是涉及金融或医疗数据的同学,我建议别把安全寄托在“一次性脱敏”上。护栏不应该是静态的墙,而应该是一个持续的、具备上下文感知能力的流式检测过程。
免费 AI 工具箱 · 全部完全免费
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。