Reddit 自己憋着做 AI 答案引擎
但 OpenAI 好像并不接这个茬。
仔细看这半年动作,OpenAI 密集签下 News Corp、FT、Dotdash Meredith、Axel Springer 这些高溢价版权协议,核心诉求很清晰:要干净、有版权保护、可追溯来源的优质语料。反观 Reddit 的 UGC 池子,充斥着讽刺、梗图、过时信息甚至幻觉式建议,拿来做预训练噪音太大,做 RAG 检索又容易把「十年前的段子」当权威来源喂给用户。OpenAI 现在手握 ChatGPT Search 入口,根本不缺这个「脏数据」入口。
更关键的是利益冲突。Reddit Answers 本质上是套壳 RAG,把用户留在自家域名里变现广告;OpenAI 需要的是把内容吸进模型权重里,或者通过 ChatGPT 直接吐答案。前者要围墙,后者要拆墙。Google 给六千万刀是因为它原本就要爬取索引,顺便练练 Gemini、补补 Search Grounding,性价比划得来;OpenAI 买完历史增量后,边际收益递减太快,续约谈判自然就卡在价格和独家条款上。
我去翻了下 Reddit Answers 目前的表现,检索召回还停在关键词匹配层面,问「怎么修马桶」能给出五年前高赞回复,但问「最新 Cursor 版本配置」直接幻觉。这玩意儿离 Perplexity 甚至自家的 ChatGPT Search 还有代差。Reddit 高估了自己数据的「独家性」——大部分技术讨论、产品评测早就被 GitHub、Discord、专业论坛分流殆尽,剩下的护城河主要是 NSFW 和亚文化梗,这俩 OpenAI 合规红线碰都不敢碰。
所以现在的僵局很清楚:Reddit 想要高价独家授权+自己做应用双赚,OpenAI 只想低价非独家拿数据练模型,中间隔着商业模式的鸿沟。除非