AI越狱

共 95 篇帖子 返回首页

#AI越狱 相关帖子

别被英语跑分骗了,多语言环境下的 LLM 安全对齐其实漏洞百出

大鹏爱学习 中级 ·AI越狱 · 424 · 3 · 10 ·4天前

大模型在评测时会“装好学生”吗?聊聊 Evaluation Awareness 带来的评估偏差

架构师老刘 中级 ·AI越狱 · 464 · 3 · 8 ·5天前

视觉信号也能成“咒语”,具身智能中的物理提示词注入到底有多可怕

增长黑客小鱼 中级 ·AI越狱 · 824 · 3 · 8 ·5天前

用数学逻辑构建陷阱,真的能让 AI 的诚实性护栏失效吗

开源爱好者小雨 专家 ·AI越狱 · 743 · 3 · 10 ·6天前

GLM-5.3-Flash 这种混合注意力架构,是在用工程暴力美学硬刚顶尖模型

老大鹏 专家 ·AI越狱 · 563 · 3 · 3 ·6天前

给 AI Agent 加上权限护栏:聊聊 Conduct 如何解决 MCP 工具调用的安全焦虑

杭漂码农 专家 ·AI越狱 · 471 · 4 · 9 ·7天前

别再迷信提示词防御了,大模型安全对齐的底层漏洞其实在神经元分布

阿Sam的日常 高级 ·AI越狱 · 804 · 4 · 9 ·7天前

深耕网络安全 20 年从 SOC 爬到 CISO 之后为何会陷入职业倦怠

北漂开源爱好者 初级 ·AI越狱 · 335 · 3 · 10 ·8天前

法律文件竟成提示词注入的温床,AI 自动化审理正面临隐形指令危机

Sam11 高级 ·AI越狱 · 800 · 3 · 12 ·8天前

为什么大模型防御层明明信心满满,却还是会被一个单词直接带偏?

Tom 中级 ·AI越狱 · 259 · 3 · 7 ·9天前

2030年之前如果只剩下五类职业,我们该如何守住最后的护城河

极客阿强 中级 ·AI越狱 · 957 · 3 · 5 ·9天前

别再试图用 Prompt 约束 AI Agent 的权限了,真正的治理得下沉到数据层

老陈 专家 ·AI越狱 · 352 · 3 · 4 ·9天前

为什么你的 AI Agent 总是被网页指令“洗脑”导致泄密

小鱼在路上 专家 ·AI越狱 · 163 · 4 · 7 ·10天前

别被 AI 护栏给骗了,很多脱敏工具在处理 PII 时其实在偷偷漏水

阿Leo的日常 中级 ·AI越狱 · 61 · 3 · 7 ·11天前

用专门的 SLM 替代通用大模型,是不是在 Coding Agent 安全防御上走对了路?

副业中测试 中级 ·AI越狱 · 213 · 4 · 0 ·11天前