AI越狱

共 95 篇帖子 返回首页

#AI越狱 相关帖子

抛弃死板的价值观对齐,Qwen-3.8-Flash-Next 去审查版实测体验如何

技术宅Ray 初级 ·AI越狱 · 646 · 10 · 15 ·12天前

利用拼写检查逻辑绕过护栏窃取 AI Agent 系统提示词的实操分析

技术宅Kevin 初级 ·AI越狱 · 556 · 3 · 4 ·13天前

别再用爬虫死磕黑产论坛了,试试用多 Agent 架构主动诱导情报

沪漂运营喵 中级 ·AI越狱 · 680 · 3 · 10 ·14天前

RLHF 带来的过度对齐是否正在阉割 AGI 的真实推理能力

早八人AI炼丹师 专家 ·AI越狱 · 582 · 4 · 4 ·15天前

给 AI Agent 喂 1.2% 的假消息,准确率竟然能从 0.85 暴跌到 0.3

技术宅Kevin 初级 ·AI越狱 · 772 · 4 · 10 ·15天前

用动力系统理论来抓大模型的“坏心思”到底靠不靠谱

大Jerry 高级 ·AI越狱 · 302 · 3 · 4 ·16天前

为什么很多 AI 模型在安全基准测试中拿高分,实际使用时却总在“过度拒答”?

在深圳设计师 中级 ·AI越狱 · 616 · 4 · 8 ·17天前

把 LLM 当成 SQL 注入来打,这种既视感太强了

大鹏爱学习 中级 ·AI越狱 · 257 · 4 · 5 ·20天前

别再死磕 Prompt 注入了,Agent 工具执行权限才是真正的安全深水区

内卷王调参侠 中级 ·AI越狱 · 578 · 3 · 7 ·20天前

别再用关键词拦截了,试试用轨迹感知防御多轮越狱攻击

产品狗小林 初级 ·AI越狱 · 755 · 3 · 3 ·21天前

当大模型走进物理世界,具身智能的攻击面将如何从代码演变为物理破坏

架构师Neo 中级 ·AI越狱 · 230 · 4 · 14 ·21天前

权重空间里的加减法:能否通过向量补偿让无审查模型重新找回对齐感

产品狗小林 初级 ·AI越狱 · 204 · 3 · 11 ·22天前

追求极致隐私的 LLM 玩家如何通过消融模型与特定托管区实现真去审查

老阿伟的日常 初级 ·AI越狱 · 323 · 4 · 3 ·23天前

别让模型被“说话方式”骗了,深挖 WIFA 如何解决 AI 过度拒绝问题

CodeSmith 高级 ·AI越狱 · 392 · 3 · 15 ·24天前

安全分越高可用性越低:警惕 LLM 陷入过度对齐的拒绝过载陷阱

小Kevin在路上 中级 ·AI越狱 · 443 · 3 · 4 ·24天前