面对 Hacker News 首页被 AI 刷屏的现状,如何过滤掉噪音?
最近在逛 HN 时发现一个很有意思的项目 hcker.news,它的切入点非常清奇:在所有 AI 工具都在抢着做“AI 新闻聚合”的时候,它反其道而行之,做了一个专门用来“剔除 AI 内容”的过滤器。
现在的 HN 首页确实太嘈杂了,很多热帖其实就是模型跑分报告或者厂商的发布通稿,对于真正关心底层技术实现的人来说,这些内容干扰极大。hcker.news 的核心逻辑不是简单的关键词屏蔽,而是构建了一套三层过滤机制,试图把那些“伪装成技术讨论的 AI 宣传”彻底清理干净。
第一层是基础的硬过滤。系统维护了一套已知的 AI 相关关键词库和域名列表,只要命中直接丢弃。但这显然不够,因为很多 AI 相关的帖子标题写得很隐晦。
第二层是引入了一个 Agent 机制。它会对第一层漏掉的剩余文章进行扫描,通过语义分析标记出疑似 AI 相关的内容并再次剔除。这种方式比正则匹配要聪明得多,能识别出那些不含“LLM”或“GPT”但实际在聊 AI 产品的帖子。
最硬核的是第三层:人工兜底。项目作者会对那些 Agent 拿不准的边缘 Case 进行亲自判定。这种“机器初筛+人工终审”的模式,让该过滤器的漏网率降到了极低。
但在体验过程中,最让我惊喜的是它对 GitHub 仓库的深度检测。现在很多“Show HN”的项目其实是 AI 自动生成的代码仓库,仅凭标题几乎无法分辨。hcker.news 并没有停留在文本分析,而是直接去深挖 Repo 的底层信号,具体查三项指标:
首先是 Commit 记录。它会扫描提交消息(commit message),寻找典型的 Agent 自动提交痕迹(比如特定的格式化模版或机器生成的描述语)。
其次是贡献者名单。它对比了一个已知的 Coding Agent 账号库,如果贡献者列表里出现了这些自动化账号,该项目会被标记为 AI 生成。
最后是文件指纹。它会扫描仓库根目录,检查是否存在模型指令文件(如 .prompt 配置文件)或 Agent 运行所需的特定配置痕迹。
这套组合拳下来,基本能把那些“AI 代笔”的 Demo 仓库给揪出来。对于那些只想看人类手写代码、研究真实工程实践的开发者来说,这种深度检测比简单的关键词过滤实用得多。
如果你想尝试,除了默认的过滤模式,这里有两个实用技巧。如果你偶尔想反向操作,只想看纯 AI 新闻,可以在请求参数中加入 ai=include,这样它就会把过滤逻辑反转,只呈现 AI 相关内容。此外,如果你想通过 RSS 订阅一个完全没有 AI 噪音的 HN 频道,也可以通过其提供的特定端点来实现。
这种对信息的“反向精简”在当下这个 AI 爆发的时代显得尤为珍贵。当所有人都在尝试用 AI 增加内容量时,能用技术手段帮用户剔除冗余,这本身就是一种极佳的产品洞察。
全部回复 (4)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
直接反向操作把AI评论全部折叠掉,现在评论区那些杠精简直没法看!