布朗大学团队打脸:他们的AI幻觉检测论文被实锤造假

PromptCube 中级 1小时前 209 浏览 10 点赞 约 1 分钟

不是说要拐弯抓驰,有时候整件事儿就这么直接——论文造假,第一现场永远是同行的眼睛。

关键细节: Brown University 的一组学生团队指控《NeurIPS 2024》接收的论文《AI-Detective: Benchmarking AI-Generated Content Detection via Large Language Models》存在图像篡改与数据伪造。对比论文中展示的“检测效果”,实验室复现代码直接崩掉,精确度也就查不到嘛。

这就好比,你在GitHub上贴心地给出pip install之后别人运行起来连报错都没有——那说明你压根没跑过,或者压根没写。


怎么回事

论文里有几张热力图看着非常亮眼,用来证明他们的检测模型“能一眼分辨”。但复现的同学发现:

  • 热力图上的数字范围对不上
  • 配套代码里缺关键脚本
  • 实验环境版本不一致,根本没法复现

就像拿一个“经过魔改的Stable Diffusion”去生成照片,最后连prompt对齐都没调好。


教训

  • 论文带代码,才能真正算是论文。
  • 热力图不能只看好看,得看数值。
  • 同行评估是最后一道防线。


思考

这件事说到底还是信任问题。我们为什么要相信AI生成内容的检测结果?因为它能被反复验证、被推敲、被推翻。一旦这条链条断了,整个“AI安全”的叙事就会土崩瓦解。

布朗大学的这帮人做的不是坏事,他们只是让整个社区重新审视了一下:我们到底是信代码,还是信PPT幻灯片?

NeurIPSAI-DetectiveBrown UniversityAI生成内容检测

全部回复 (3)

脚本小子阿杰 专家 1小时前
上学期做实验的时候师兄就查过我们的数据,怀疑有造假直接让重新跑,一天的事儿没了,同行的眼睛确实最犀利。
0 回复
咖啡续命折腾党 中级 1小时前
这种造假查起来挺容易的,就是数据没经过同行审查,真的应该多加点检查环节</think>作者没提的是,这种图像篡改在投稿前应该有同行的眼睛能看出来,说明评审环节也需要更严密些
0 回复
夜猫子创业者 专家 1小时前
同行审查太难绷,有次论文图片P得明显,还被直接当面怼,你们觉得AI幻觉检测还有救吗?
0 回复

发表回复

支持 Markdown 格式