灵感魔方 PromptCube
首页
AI模型讨论
提示词分享
工作流交流
问题求助
资源分享
行业动态
AI编程实战
AI越狱
AI 工具合集
搜索
中文
EN
首页
/
AI越狱
AI越狱
92 篇帖子
排序:
最新
最热
最多回复
AI越狱 — 全部帖子
用轨迹追踪来对抗多轮越狱攻击这思路挺有意思
产品狗小林
初级
·
748
·
3
·
3
·
2026/8/18
AI越狱
AI安全
GRPO
Trace
Llama-3.1-8B-Instruct
把大模型塞进机器人身体里,安全漏洞就不再只是屏幕上的乱码
架构师Neo
中级
·
224
·
4
·
14
·
2026/8/18
AI越狱
具身智能
Embodied Agent
Foundation Models
物理安全
把大模型的对齐给“抹掉”之后还能找回来,这事儿挺有意思
产品狗小林
初级
·
199
·
3
·
11
·
2026/8/17
AI越狱
AI安全
Alignment
Abliteration
Weights
用禁书来测试大模型,结果发现现在的 LLM 几乎不再死板地拒绝回答了
副业中创业者
初级
·
73
·
3
·
7
·
2026/8/16
GPT-4o
DeepSeek-V3
Claude Sonnet 4.5
Gemini 2.5 Flash
Qwen-Plus
想找完全不记录输入输出的去审查模型,得盯着美国或欧盟的托管服务看
老阿伟的日常
初级
·
315
·
4
·
3
·
2026/8/16
AI越狱
AI安全
GDPR
Abliteration
GGUF
让模型学会拒绝的是“恶意意图”还是单纯的“说话方式”?
CodeSmith
高级
·
384
·
3
·
15
·
2026/8/15
Llama
AI越狱
Qwen
WIFA
OR-Bench
现在的 AI 安全测试逻辑其实陷入了一个怪圈,测试本身反而成了风险源
小Kevin在路上
中级
·
437
·
3
·
4
·
2026/8/15
AI越狱
AI安全
LLM安全
Red Teaming
Alignment
GitHub 上那些疯狂刷 Push 的僵尸号到底在搞什么鬼
小Ray在路上
中级
·
328
·
3
·
8
·
2026/8/14
AI越狱
AI安全
github
GH Archive
Botnet
给大模型设定个“人设”居然能改变它的安全判定标准,这事儿挺离谱的
阿Leo的日常
中级
·
507
·
3
·
0
·
2026/8/13
AI越狱
AI安全
LLM Safety
TraSN
TIST
LLM 成了 Web 漏洞的传声筒,这让传统的攻击链路变得诡异了
JulesCrafter
初级
·
681
·
3
·
9
·
2026/8/12
AI越狱
AI安全
Flask
LLM2SSRF
TicketOracle
用自动化安全实验室给大模型做压力测试比上线后修补漏洞要高效得多
开源爱好者小雨
专家
·
324
·
4
·
5
·
2026/8/12
openai
AI越狱
AI安全
python
JSON
把大厂隐藏的推理链通过低端模型给“骗”出来这招真的绝
折腾党小雨
中级
·
241
·
3
·
0
·
2026/8/11
openai
AI越狱
anthropic
Google
Chain-of-Thought
把 AI Agent 扔进公开提示词池子里跑红队测试到底能测出多少漏
脚本小子阿强
初级
·
366
·
4
·
4
·
2026/8/11
AI越狱
AI安全
python
github
Red-Teaming
让几个大模型投票来决定内容安不安全,结果居然会被“带节奏”
躺平产品经理
初级
·
828
·
4
·
3
·
2026/8/10
AI越狱
AI安全
LLM Safety
Majority Voting
False-Alarm Rate
苹果那个私有云计算 PCC 真的像它宣传的那么无懈可击吗
阿老张在路上
高级
·
295
·
4
·
10
·
2026/8/10
AI越狱
AI安全
Apple
Private Cloud Compute
Sentry Security
‹
1
2
3
4
5
6
7
›
扫码进群
复制微信号
扫码进交流群
微信扫一扫,加入 AI 交流群
或搜索微信号
luyisi2002
关闭