只靠分析结构就能分辨出 AI 写的网页,这事儿居然能达到 98% 的准确率
我们在公司内部推行 AI 创作的时候,最头疼的就是那些一眼就能看出来的“AI 味”内容。虽然现在很多工具号称能去 AI 化,但其实只要稍微有经验的人,扫一眼结构就能发现端倪。最近看到 Sitefire 团队在 HN 分享的一个实测,他们不看具体的词汇,只分析网页的结构特征,结果发现 AI 写作的模式化极其严重,这给我们在公司筛选和优化 AI 内容提供了很直接的参考。
为什么单纯靠结构就能识别 AI 垃圾内容
Sitefire 的这两个创始人(一个是斯坦福 RL 背景,一个是慕尼黑工大软件工程背景)做了一个实验,他们参考了 2026 年 Russell 等人发布的 StoryScope 论文,把那种分析小说结构的逻辑搬到了 undefinedB 商业网页上。
他们从 Wayback Machine 找了 268 家 undefinedB 公司的 2,250 篇在 ChatGPT 出现之前的博文作为人类样本,然后让 GPT-5.4、Claude Sonnet 4.6、Gemini 3 Flash、DeepSeek V3.2 和 Kimi K2.5 这五款模型针对同样的主题写版本。
识别逻辑不是靠关键词匹配,而是让 AI 针对每篇文章回答 214 个关于结构的问题。比如:这篇文章推产品的力度有多大?有没有提供来源支撑?是否引用了具体专家的名字?然后用这些回答训练一个分类器。
实测结果非常惊人:在 1,740 篇从未见过的博文中,分类器分辨人类和 AI 写作的准确率高达 98%,仅错了 19 篇。
揭秘 AI 写作的“结构性指纹”
这次实测揭示了一个很残酷的真相:现在的 AI 模型虽然词汇量大,但写东西的“形状”几乎一模一样。
- 重复性极高: 典型的 AI 垃圾内容习惯于把同一件事说三遍。标题先预告一遍,开头再铺垫一遍,结尾最后总结一遍。
- 结论分布: 77% 的 AI 生成博文会在结尾重复核心观点,而人类博文只有 12% 这么做。这种“自我宣布式”的整洁结构成了 AI 的标志。
- 独特性差异: 在数据集里最独特的那 1% 的文章中,有 149 篇是人类写的,而 AI 写的只有 4 篇。
识别不同模型的“口音”
除了分辨人机,他们还训练了第二个分类器来区分具体是哪个模型写的。在 GPT-5.4、Claude Sonnet 4.6、Gemini 3 Flash、DeepSeek V3.2、Kimi K2.5 和人类这 6 个选项中,分类器的正确率是 79%(随机猜测只有 17%)。
有个细节很有意思:分类器几乎所有的错误都发生在 AI 模型之间的互认上,而很少把人类写的内容误认为某个特定模型。这意味着,虽然不同模型之间有细微的“口音”区别,但它们整体上都处于一个名为“AI 结构”的簇群里,与人类写作的分布完全不同。
落地到公司内容生产的启示
这对我们这些在公司里负责 AI 落地的人来说很有参考价值。如果你发现你的 AI 文案被读者吐槽“没营养”,不要只在 Prompt 里加“请用自然语言写作”这种废话,而应该从结构上强制干预:
1. 禁止总结性结尾: 强制要求 AI 不要在结尾复述一遍文章要点,打破那种“总之/综上所述”的 AI 惯例。
2. 增加非对称信息: 引导 AI 增加具体专家的引用或真实的来源支撑,而不是让它生成那种四平八稳的概括。
3. 打破预告式开头: 避免让 AI 在开头写“本文将为您介绍 X, Y, Z”,直接切入场景。
虽然这次实测的人类样本时间线在 2020-2022 年,而 AI 样本是 2026 年 8 月生成的,但结构化特征的差异依然如此明显。这证明了只要模型底层的逻辑不改变,单纯靠微调词汇是无法逃避“AI 感”的。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
全靠 LLM 定阈值也太离谱了,这种 lossy 的方案根本没法保证结果可复现。