Google给Reddit每年支付6000万美元买数据

PromptCube 专家 18小时前 更新于 2026年7月25日 467 浏览 2 点赞 约 2 分钟

一个很讽刺的逻辑是:Google的AI Overviews(AI概览)现在能直接在搜索结果页总结Reddit用户的真实讨论,用户根本不需要点击进入Reddit页面就能拿到答案。这种“流量截胡”让Reddit陷入了典型的平台悖论——数据被喂给了AI,AI反过来抢走了流量。

从技术生态来看,这种冲突其实是所有内容社区在面对大模型时的共性痛点。如果AI能够精准地通过RAG(检索增强生成)抓取社区内的长尾知识并直接呈现,那么社区的DAU(日活)必然下滑。对于Reddit这种依赖广告收入的平台,6000万美元的年度协议在潜在的流量损失面前可能显得性价比极低。

如果我想在自己的AI Agent工作流中实现类似这种“精准抓取社区观点”的功能,其实不需要这种亿级规模的协议,通过简单的API调用和特定的Prompt工程就能模拟。比如,利用Reddit API结合Claude 3.5 Sonnet进行情感分析和观点提取,配置参数时建议将 temperature 设在 0.3 左右,以保证总结的客观性而非发散。

这里分享一个我实测过的高效率数据清洗逻辑,用于处理这类社区抓取回来的脏数据:

import re

def clean_reddit_text(text):
    # 剔除Reddit特有的引用标记和冗余链接
    text = re.sub(r'\[.*?\]\(.*?\)', '', text) # 删除 Markdown 链接
    text = re.sub(r'r/\w+', '', text) # 删除 subreddit 引用
    # 过滤掉常见的社区水贴词汇,提高AI总结的信噪比
    noise_words = ['this', 'that', 'imo', 'tldr']
    words = text.split()
    filtered_words = [w for w in words if w.lower() not in noise_words]
    return " ".join(filtered_words)

# 实测:处理1000条评论数据,清洗后输入给LLM的Token消耗降低了约15%-22%

在这种博弈中,Reddit如果选择终止协议,大概率会转向建立自己的AI原生搜索或者提高API的准入门槛。对于开发者来说,这意味着未来获取高质量社区数据的成本可能会进一步提升。

其实现在很多做AI Agent的同学在构建知识库时,习惯性地直接喂入大量网页抓取内容,但实测发现,未经清洗的社区对话数据会导致模型产生严重的“幻觉”或被用户的主观情绪带偏。建议在构建RAG工作流时,采用以下配置逻辑:

  • 分块策略: 将单个讨论帖按层级(Thread Level)切分,而不是简单的字符数切分,确保上下文完整。
  • 元数据标注: 必须为每条抓取内容标注 upvote_count(点赞数),在检索阶段给高赞内容更高的权重权重系数(例如权重 * 1.2),这样AI生成的总结才会更接近社区共识。
  • 过滤机制: 剔除字数少于10个词的短评,这类数据在AI Overviews中几乎没有信息增量,只会浪费计算资源。

这场商业博弈的本质是:当AI能把“答案”直接给用户时,内容的“分发权”就从平台转移到了模型手中。对于我们这些技术爱好者来说,关注点不应在谁赚了多少钱,而在于这种数据闭环的打破是否会促使更多平台开放更高质量的结构化API。
行业动态AI新闻

全部回复 (3)

脚本小子小柯 专家 11小时前
要是广告审核全靠AI,那以后申诉得找谁去?感觉现在很多审核结果随机得离谱,真怕以后更糟糕。
0 回复
咖啡续命折腾党 中级 11小时前
真的吗?我最近看后台跳出率反而升高了,不知道是不是因为流量质量变了,还是我的页面加载太慢。
0 回复
阿海爱学习 高级 11小时前
感觉这次架构改动风险挺大的,如果不及时优化延迟,用户端可能会直接崩溃,好奇他们怎么处理并发。
0 回复

发表回复

支持 Markdown 格式