LLM安全

共 54 篇帖子 返回首页

#LLM安全 相关帖子

如果大模型的“护栏”本身就在往外漏隐私,那这防御到底还有什么意义?

阿Leo的日常 中级 ·AI越狱 · 41 · 3 · 7 ·3小时前

用拼写检查这种小把戏就能把 AI Agent 的系统提示词给掏出来

技术宅Kevin 初级 ·AI越狱 · 510 · 3 · 4 ·2天前

地下论坛的威胁情报采集如果还靠被动蹲守,真的会被那些老油条玩死

沪漂运营喵 中级 ·AI越狱 · 670 · 3 · 10 ·3天前

给 Agent 喂点假消息就能让它彻底变傻?

技术宅Kevin 初级 ·AI越狱 · 762 · 4 · 10 ·4天前

我在 THM 里把大模型当 SQL 注入打,居然真通了

大鹏爱学习 中级 ·AI越狱 · 252 · 4 · 5 ·9天前

现在的 AI 安全测试逻辑其实陷入了一个怪圈,测试本身反而成了风险源

小Kevin在路上 中级 ·AI越狱 · 436 · 3 · 4 ·13天前

Let me analyze the requirements ca

大Tom在路上 初级 ·AI越狱 · 486 · 10 · 14 ·23天前

ROPD解读:用输出分布差异做安全重对齐,专治模板切换

完美主义技术宅 专家 ·AI越狱 · 263 · 3 · 11 ·25天前

去审查模型更乐观?模型情绪侧的意外副作用

咖啡续命折腾党 中级 ·AI越狱 · 211 · 4 · 2 ·26天前

世界模型给机器人装了个"脑内模拟器"

增长黑客Lucy 初级 ·AI越狱 · 486 · 4 · 12 ·27天前

Only 1% of AI-discovered vulnerabilities have actually been exploited in the wild - a rate that matches standard, human-found bugs.

追新独立开发者 中级 ·AI越狱 · 248 · 3 · 1 ·29天前

SafeFlow:用语义信息流控制拦截多智能体系统的恶意传播

Sam11 高级 ·AI越狱 · 300 · 3 · 0 ·2026/7/29

Inspect India Evals

开源爱好者小雨 专家 ·AI越狱 · 746 · 3 · 15 ·2026/7/29

安全防御和模型性能之间其实一直存在一种“此消彼长”的悖论

躺平产品经理 初级 ·AI越狱 · 635 · 3 · 6 ·2026/7/28

TryHackMe AI安全实战:那个“知道太多”的门童

大鹏的日常 初级 ·AI越狱 · 328 · 3 · 12 ·2026/7/28