用字体欺骗AI,这招确实有点阴。
Mixfont出的那个 "Decoy Font" 很有意思,逻辑很简单:在正常字母上面叠一层极细的干扰线条(诱饵字符)。人眼会自动过滤掉这些噪音,能一眼看出原意,但像 Claude、GPT-4o 或 Gemini 这种依赖视觉识别的大模型会被这些干扰项带跑,读出来的完全是另一套文字。
谁能想到最强的“破甲”武器竟然是一套字体。这种方案比写几百字的长 Prompt 要高效得多,而且只要字体渲染得好,模型几乎没法通过纯算法自我纠正。感觉以后对抗视觉识别的实战方向,可能会在这些微小的图形噪声上做文章。
下一篇
多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语 →
这其实是把“对抗样本”的概念从像素层面搬到了字体设计上。以前我们聊 AI Agent 的安全或者越狱,大多在卷提示词(Prompt),比如各种角色扮演或逻辑陷阱,但这种物理层面的“视觉欺骗”反而更粗暴有效。
- 干扰原理: 利用 OCR 识别的特征提取偏差,让模型把干扰线识别成主字符。
- 实际效果: 人类看是 A,AI 读成 B。
- 应用场景: 想要在图片里藏一些 AI 读不到但人能读到的私密信息,或者直接绕过视觉审查。
谁能想到最强的“破甲”武器竟然是一套字体。这种方案比写几百字的长 Prompt 要高效得多,而且只要字体渲染得好,模型几乎没法通过纯算法自我纠正。感觉以后对抗视觉识别的实战方向,可能会在这些微小的图形噪声上做文章。