AI安全

共 91 篇帖子 返回首页

#AI安全 相关帖子

RLHF 带来的过度对齐是否正在阉割 AGI 的真实推理能力

早八人AI炼丹师 专家 ·AI越狱 · 582 · 4 · 4 ·15天前

给 AI Agent 喂 1.2% 的假消息,准确率竟然能从 0.85 暴跌到 0.3

技术宅Kevin 初级 ·AI越狱 · 772 · 4 · 10 ·15天前

把 LLM 当成 SQL 注入来打,这种既视感太强了

大鹏爱学习 中级 ·AI越狱 · 257 · 4 · 5 ·20天前

别再死磕 Prompt 注入了,Agent 工具执行权限才是真正的安全深水区

内卷王调参侠 中级 ·AI越狱 · 578 · 3 · 7 ·20天前

别再用关键词拦截了,试试用轨迹感知防御多轮越狱攻击

产品狗小林 初级 ·AI越狱 · 755 · 3 · 3 ·21天前

权重空间里的加减法:能否通过向量补偿让无审查模型重新找回对齐感

产品狗小林 初级 ·AI越狱 · 204 · 3 · 11 ·22天前

追求极致隐私的 LLM 玩家如何通过消融模型与特定托管区实现真去审查

老阿伟的日常 初级 ·AI越狱 · 323 · 4 · 3 ·23天前

安全分越高可用性越低:警惕 LLM 陷入过度对齐的拒绝过载陷阱

小Kevin在路上 中级 ·AI越狱 · 443 · 3 · 4 ·24天前

GitHub 上那些每小时推送上万次代码的僵尸号到底在操纵什么

小Ray在路上 中级 ·AI越狱 · 332 · 3 · 8 ·25天前

给大模型设定人设竟然能左右安全判定,这种特质诱导偏差怎么破

阿Leo的日常 中级 ·AI越狱 · 519 · 3 · 0 ·26天前

别再只盯着 Prompt 注入了,LLM 正在成为 Web 漏洞的超级中转站

JulesCrafter 初级 ·AI越狱 · 690 · 3 · 9 ·27天前

用自动化安全实验室给大模型做压力测试比上线后修补漏洞要高效得多

开源爱好者小雨 专家 ·AI越狱 · 327 · 4 · 5 ·27天前

别再用温室测试集了,试试把 AI Agent 扔进公开提示词池子做红队压力测试

脚本小子阿强 初级 ·AI越狱 · 370 · 4 · 4 ·28天前

大模型投票机制失效:当评审团陷入“集体盲从”的误判陷阱

躺平产品经理 初级 ·AI越狱 · 834 · 4 · 3 ·29天前

别被提示词注入骗了,苹果 PCC 的真正安全漏洞可能藏在底层架构里

阿老张在路上 高级 ·AI越狱 · 300 · 4 · 10 ·29天前