Perplexity 这种搜索引擎到底在抓谁的数据?
看到一个挺有意思的数据:Perplexity 在回答问题时,竟然高度依赖那三个特定网站生成的 21.5 万个所谓的“最佳软件”推荐页面。这种现象让我想起以前 SEO 圈子里那种靠批量生成垃圾内容来霸占搜索结果的套路,现在居然演变成了大模型时代的“喂料”逻辑。
这让我想起之前讨论过的模型幻觉问题,如果喂给模型的数据本身就是这种高度同质化的“SEO 垃圾”,那 AI 给出的推荐建议其实是在循环论证。它不是在告诉你哪个软件好用,而是在告诉你:在这堆被程序化生成的页面里,哪个关键词出现的频率最高。
简单拆解一下这个逻辑:这三个网站通过极其标准化的模板,针对成千上万个细分工具关键词,批量生产了超过 21 万个页面。每个页面的结构几乎一模一样,内容也是围绕“XX 软件哪个好”、“XX 工具对比”这种逻辑在跑。
- 内容模式: 它们并不生产深度评测,而是通过程序化的方式,把软件的功能点、价格、优缺点塞进一个固定的 HTML 模板里。
- 流量闭环: 这种页面的存在不是为了让人阅读,而是为了让爬虫抓取。一旦被 Perplexity 这种 AI 搜索引擎收录,当用户问“最好的视频剪辑软件是什么”时,AI 就会直接引用这些页面里的结论。
- 数据污染风险: 这其实是一个很危险的信号。如果 AI 搜索的底层逻辑是“谁的页面多、谁的结构标准,我就信谁”,那么未来的搜索结果可能不再是基于真实的专业测评,而是基于谁更擅长用程序生成“伪专业”的内容。
这让我想起之前讨论过的模型幻觉问题,如果喂给模型的数据本身就是这种高度同质化的“SEO 垃圾”,那 AI 给出的推荐建议其实是在循环论证。它不是在告诉你哪个软件好用,而是在告诉你:在这堆被程序化生成的页面里,哪个关键词出现的频率最高。
这种靠规模化生产低质量信息来收割 AI 流量的行为,本质上是在给大模型的知识库“投毒”。我们现在的 AI 搜索,究竟是在寻找真相,还是在为一个巨大的、由模板驱动的内容黑洞做注脚?
事件追踪 · 相关报道
学校里这种针对 AI 的“红绿灯”式作业管理法其实挺有意思
8天前
英伟达这次把钱砸向 Perplexity
9天前
Google 给站长的新「止损工具」,本质只是把 robots.
11天前
我现在见到搜索结果顶部那块 AI Overview 就想装个 uBl
12天前
AI 承诺的「人人都爱用」时刻,怎么还没到?
13天前
把浏览器插件当成简单的功能增强太低估它们了
17天前
免费 AI 工具箱 · 全部完全免费
全部回复 (11)
阿
阿福在路上
高级
3小时前
其实换个思路用一些关键词组合或者利用现在的AI搜索插件,有时候反而能挖出不少宝藏,慢慢适应一下新的逻辑就好了。
0
老
老阿凯
中级
3小时前
@阿福在路上 确实有这种感觉,不过你觉得这种逻辑在处理长尾需求时,精准度能比传统检索高多少?
0
老
我觉得模型坍缩(Model Collapse)这事儿迟早会发生。现在很多数据清洗工具都在死磕“合成数据检测”,但感觉就像在玩猫鼠游戏,总有办法绕过去的。真要是全网都是AI垃圾内容,恐怕以后高质量的语料库得像黄金一样贵了。
0
阿
产
在
前
早
咖
数
远