ArXiv 今天的论文提交量快到 600 篇了
现在的学术预印本平台 ArXiv 真的快被大模型给冲垮了。今天我扫了一眼当天的 Submission 列表,整整 600 多篇投稿,这种量级在以前确实值得关注,但现在的质量分布极其诡异:绝大部分看起来都像是用 LLM 批量生成的“AI Slop”。
如果这种趋势继续下去,ArXiv 这种作为科研前哨站的权威性会被严重稀释。现在的研究者如果不加甄别地去检索文献,很容易被这种看起来很专业的“AI 垃圾”带偏,甚至误以为某个方向有了突破。这种大规模的低质量内容涌入,本质上是 AI 生产力在学术领域的一次负向溢出,研究员的时间正在被这些毫无价值的字符浪费掉。
这种现象最恶心的地方在于,这些论文并不是那种纯粹的胡言乱语,而是利用大模型极其擅长的“学术腔”进行套壳。它们会堆砌大量的专业术语,构建一个看起来逻辑自洽、引用了大量真实文献、甚至连数学公式都排版得极其精美的框架,但当你试图去深挖它的实验设计或者核心创新点时,会发现整个论证逻辑是空洞的,甚至连实验数据都是模型编造出来的。
我观察到几个典型的“灌水论文”特征:
- 逻辑循环论证: 论文的结论部分几乎只是把摘要和引言用不同的措辞又复述了一遍,没有任何实质性的推导过程。
- 参考文献“幻觉化”: 引用列表里确实有真论文,但它们之间的关联性极其牵强,甚至有些论文被强行挂钩到一个完全无关的领域。
- 实验结果过于“完美”: 数据曲线平滑得不真实,没有任何噪声,这种典型的生成式特征在实际科研中几乎不存在。
如果这种趋势继续下去,ArXiv 这种作为科研前哨站的权威性会被严重稀释。现在的研究者如果不加甄别地去检索文献,很容易被这种看起来很专业的“AI 垃圾”带偏,甚至误以为某个方向有了突破。这种大规模的低质量内容涌入,本质上是 AI 生产力在学术领域的一次负向溢出,研究员的时间正在被这些毫无价值的字符浪费掉。
事件追踪 · 相关报道
论文录用后要把 Preprint 变成 Camera-ready 版
8天前
通过 API 强行扒出大模型隐藏思考过程这件事真的挺细思极恐的
20天前
AI 把互联网当养料吞掉后,我们可能再也找不到真实的原始记录了
21天前
告别人类论文时代?ARA 协议想重新定义科研成果格式
26天前
免费 AI 工具箱 · 全部完全免费