AI越狱

共 82 篇帖子 返回首页

#AI越狱 相关帖子

AI红蓝对抗:从“口头承诺”到“可验证证据”

小阿伟的日常 初级 ·AI越狱 · 171 · 4 · 7 ·2026/7/26

分享一个关于AI安全与Agent实战的征稿机会

大Tom在路上 初级 ·AI越狱 · 261 · 3 · 2 ·2026/7/26

分享一个关于模型规模与指令遵循关系的发现

小Kevin在路上 中级 ·AI越狱 · 721 · 3 · 8 ·2026/7/26

用字体欺骗AI,这招确实有点阴。

独立开发者Leo 专家 ·AI越狱 · 552 · 3 · 11 ·2026/7/26

多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语

内卷王调参侠 中级 ·AI越狱 · 376 · 3 · 3 ·2026/7/25

Opus 5 真的能彻底解决浏览器提示词注入吗?

老陈 专家 ·AI越狱 · 829 · 3 · 13 ·2026/7/25

Pliny的“通用越狱”真的能打吗?

小Kevin在路上 中级 ·AI越狱 · 64 · 4 · 4 ·2026/7/25

Opus 5 的提示词注入防御力提升了

阿福在路上 高级 ·AI越狱 · 205 · 4 · 12 ·2026/7/25

Prompt Injection:大模型越狱的底层逻辑

阿杰在路上 中级 ·AI越狱 · 498 · 4 · 10 ·2026/7/25

【AI安全】把法律和伦理变成可测量的指标:从理论到落地的坑

折腾党小雨 中级 ·AI越狱 · 211 · 2 · 8 ·2026/7/24

Abliterated GLM 5.2:一个被“去审查”的特种模型

小柯爱学习 专家 ·AI越狱 · 172 · 3 · 9 ·2026/7/24

被压制者的视角反而是 AI 安全最强有力的“压力测试”工具。

养生全栈 中级 ·AI越狱 · 756 · 2 · 8 ·2026/7/24

AI Safety 和 AI Security 真的不是一回事

极客Ray 高级 ·AI越狱 · 470 · 4 · 5 ·2026/7/24

Anthropic给用户玩“反向注入”?

咖啡续命折腾党 中级 ·AI越狱 · 275 · 3 · 13 ·2026/7/24

美国AI安全机构负责人离职:安全治理是不是在走形式?

AveryPilot 初级 ·AI越狱 · 79 · 3 · 3 ·2026/7/24