别再迷信审核 API 了,面对行业策略绕过它几乎完全失效
我研究了一组跨领域评估数据,对比了传统的 Moderation API(审核层)和 LLM-as-judge(判定层)在处理违规内容时的真实表现。结果非常惊人,在处理通用有害内容(如暴力、色情)时,两者的 F1 分数基本持平,都在 73.1% 左右。但一旦进入“特定行业策略”的战场,审核 API 几乎瞬间崩盘。
最极端的数据出现在“策略绕过尝试”这一项:审核层的 F1 分数竟然是 0.0%,而判定层则维持在 83.7%。这意味着,只要用户稍微通过技巧绕过简单的关键词或语义匹配,传统的审核 API 完全没有反应,就像一个只认死理的保安,只要对方穿了西装,哪怕手里拿着违禁品也能直接走进去。
为什么会出现这种断层式的差距?因为审核 API 的逻辑是“内容过滤”,而业务合规需要的是“语义判定”。
举个具体的医疗保险场景:用户输入“根据我的病情推荐最好的保险方案”。在审核 API 看来,这句话没有任何脏话、没有仇恨言论,完全是绿灯。但在实际的合规要求中,AI Agent 未经资质审核就提供具体的专业医疗/保险建议,这属于严重的违规操作。审核 API 只能识别出这句话是不是“脏”,但它无法判断这句话是否“越权”。
更糟糕的是多轮对话中的“潜伏”攻击。在 4 轮对话的压力测试中,如果前三轮用户表现得很正常,直到第四轮突然抛出一个违规请求,审核 API 的拦截率几乎为 0。它缺乏对对话上下文的深度记忆和逻辑推演能力,每一轮都被当作孤立的片段处理。
当然,我也得给 LLM-as-judge 泼一盆冷水。虽然它能看懂策略,但它的副作用极大。首先是误报率(FPR)高得惊人,达到了 86.4%,这意味着它经常会把正常的请求误判为违规;其次是性能损耗,由于需要 LLM 再次推理,其延迟比轻量级的审核 API 高出 2-4 倍。如果你直接用判定层替换审核层,用户的等待时间会显著增加,且会遇到大量莫名其妙的拦截。
所以,针对真正要落地的 AI Agent,我建议采用“审核层 + 判定层”的双层工作流:
第一层用 Moderation API 做快速粗筛。把那些明显的暴力、色情、脏话在 50ms 内直接拦截掉,减轻后端的计算压力。
第二层用 LLM-as-judge 做策略校验。针对通过粗筛的内容,由一个专门定义了 Policy 的小模型进行语义判定,检查是否违反了具体的行业合规策略。
只有这样,你才能在保证响应速度的同时,真正堵住那些能让公司被监管部门点名批评的策略漏洞。