律师用 AI 编造谋杀案证人被罚 5000 美元这件事给我的启发

自由职业运营喵 高级 8小时前 433 浏览 2 点赞 约 3 分钟

直接说结论:如果你打算用 LLM 写正式文档(尤其是法律、医疗、财务类),千万别把 AI 生成的引用、证词或案例直接贴进去,除非你逐一去原件里核对。这次新墨西哥州最高法院罚 Stephen Aarons 5000 美元的案例,最核心的坑在于他把 AI 幻觉产生的“虚构证人”和“假警察证词”直接当成事实提交了,结果被法官当庭揪出。

为什么这次罚款是对所有 AI 使用者的警告

很多人觉得 AI 偶尔胡说八道没关系,但在专业领域,这种“幻觉”是致命的。在这个案件里,律师提交的简报中不仅出现了完全不存在的证人,连凶手的穿着描述都是 AI 瞎编的。最离谱的是,法官 C. Shannon Bacon 在 8 月的听证会上直接质疑他怎么会对 AI 的风险这么不敏感。

这说明在专业评审眼中,AI 生成内容不经过人工验证,就等同于“玩忽职守”。如果你在公司报告里用 AI 编了一个数据趋势,或者在论文里用 AI 造了一个引用,一旦被发现,这就不再是“技术误差”,而是“诚信问题”。

避坑指南:如何防止在专业文档中出现幻觉

我之前在处理一些需要极高准确度的文档时,尝试过几种方案,结论是不能依赖 AI 的“记忆”,而要把它当成“处理器”。

一、 强制要求 AI 标注来源,并手动核对
不要问「关于 X 案件的法律依据是什么」,而要给它具体的文档,然后问「在附件的 PDF 第几页提到了 X」。

# 错误示范
请帮我写一段关于新墨西哥州证据法的论述,并引用相关案例。

# 正确示范
我已经上传了《新墨西哥州证据法》原文,请根据文档内容总结关于证人资格的规定,并在每段结论后标注具体的页码和条款号。如果没有找到,请直接回答“文档中未提及”。

二、 建立“双模型验证”机制
如果一个事实点非常关键,我会用两个完全不同架构的模型(比如 Claude 3.5 Sonnet 和 GPT-4o)分别提取信息。如果两个模型给出的引用页码或具体描述不一致,那么这个点 100% 是幻觉区,必须回溯到原始纸质/电子文档中人工核实。

三、 警惕 AI 的“讨好倾向”
AI 为了完成任务,倾向于给你一个看起来很完整的答案,哪怕它是编的。在 Prompt 里加入「如果无法在提供素材中找到答案,请诚实告知,不要尝试猜测或补全」能有效降低幻觉率,但依然不能完全消除。

成本与风险评估

这次案例中,律师损失了 5000 美元的罚金,但更严重的是专业名誉的受损。对于我们普通开发者或职场人来说,这种风险同样存在。

  • 时间成本: 逐条核对 AI 生成的引用,耗时通常是直接生成结果的 3-5 倍。但如果不核对,一旦出错,修正成本可能是毁灭性的。
  • 金钱风险: 在法律或金融合同中,一个错误的条款可能导致数万甚至数百万美元的损失。
  • 失败可能性: 只要你还在用 RAG(检索增强生成)之外的纯模型生成模式,幻觉发生的概率永远大于 0。
律师用 AI 编造谋杀案证人被罚 5000 美元这件事给我的启发
总之,不要把 AI 当成搜索引擎,而要把它当成一个阅读速度极快但记忆力极差、且爱吹牛的实习生。你必须在它提交工作前,像审校一样把每一个数字和人名核对一遍。
LLM HallucinationStephen Aarons
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。

全部回复 (4)

老大鹏 专家 8小时前

太离谱了,我上次用 Perplexity 搜论文引用结果它编了三个根本不存在的页码,差点把导师气死。

0 回复
阿Sam的日常 高级 8小时前

这种概率极高,你试过用 Claude 跑一遍吗?我觉得它编造的逻辑更离谱。

0 回复
折腾党阿凯 中级 8小时前

5000美金都算轻的,关键是这律师得在同行面前丢脸到死,要是被法官用那种眼神盯着看 10 分钟……

0 回复
大Jerry 高级 8小时前

5000刀简直是给面子,我上次用 Claude 写报告,它一本正经地编了个统计数据,差点让我被老板当众撕脸,现在看到 PDF 引用就心慌。

0 回复

发表回复

支持 Markdown 格式