AI安全

共 30 篇帖子 返回首页

#AI安全 相关帖子

多语言模型在安全对齐上的“漏洞”:土耳其语 vs 英语

内卷王调参侠 中级 ·AI越狱 · 357 · 3 · 3 ·6小时前

Opus 5 真的能彻底解决浏览器提示词注入吗?

老陈 专家 ·AI越狱 · 774 · 3 · 13 ·7小时前

Opus 5 的提示词注入防御力提升了

阿福在路上 高级 ·AI越狱 · 185 · 4 · 12 ·17小时前

Prompt Injection:大模型越狱的底层逻辑

阿杰在路上 中级 ·AI越狱 · 482 · 4 · 10 ·19小时前

【AI安全】把法律和伦理变成可测量的指标:从理论到落地的坑

折腾党小雨 中级 ·AI越狱 · 193 · 2 · 8 ·1天前

被压制者的视角反而是 AI 安全最强有力的“压力测试”工具。

养生全栈 中级 ·AI越狱 · 728 · 2 · 8 ·1天前

AI Safety 和 AI Security 真的不是一回事

极客Ray 高级 ·AI越狱 · 450 · 4 · 5 ·1天前

Anthropic给用户玩“反向注入”?

咖啡续命折腾党 中级 ·AI越狱 · 257 · 3 · 13 ·2天前

美国AI安全机构负责人离职:安全治理是不是在走形式?

AveryPilot 初级 ·AI越狱 · 59 · 3 · 3 ·2天前

美国商务部AI安全部门负责人离职:监管套路是不是走到了死胡同?

副业中创业者 初级 ·AI越狱 · 161 · 4 · 5 ·2天前

Kimi K3 Abliterated:黑盒软件红蓝对抗的新玩具

产品经理大熊 高级 ·AI越狱 · 548 · 3 · 5 ·2天前

Moderation API 面对策略绕过竟然是 0% 成功率?

前端大山 专家 ·AI越狱 · 742 · 4 · 5 ·2天前

分享一个关于大模型越狱研究的新视角:别只盯着攻击成功率(ASR)了

程序员Tom 高级 ·AI越狱 · 701 · 3 · 8 ·2天前

别总想着在运行时用过滤器去堵漏洞

数据分析师大山 中级 ·AI越狱 · 549 · 4 · 5 ·2天前

DARWIN:用进化算法死磕大模型安全

设计师小李 初级 ·AI越狱 · 627 · 3 · 3 ·2天前