用 Claude 3.5 搭建国际新闻自动化过滤流的实战经验
很多在做信息流自动化的人都有个误区,觉得只要把新闻链接丢给 AI,让它总结一下就行。但实际操作下来你会发现,这种“总结式”的问法得到的答案极其水,基本都是在重复原文的废话,完全没有把碎片化信息转化为可利用的知识。
最近我在处理一些类似“巴西拒绝美国官员签证”这种短促且带有政治敏感度的国际新闻时,尝试了一套从“提取-结构化-沉淀”的 Agent 工作流,效果比直接对话好得多。这里分享几个具体的实操细节。
首先是关于指令构建的逻辑。处理碎片化新闻最忌讳模糊指令,我现在的做法是强制要求 AI 输出 JSON 格式。因为一旦进入 JSON 结构,AI 就会从“文学创作模式”切换到“数据提取模式”,这能极大地降低它产生冗余修饰词的概率。
我给 Claude 3.5 设定的提取结构非常简单,只包含四个字段:event(事件核心)、core_conflict(核心冲突点)、sentiment(情绪基调)和 tags(关联标签)。以那条巴西签证新闻为例,AI 提取出的结果是 {"event": "Brazil visa denial to US officials", "core_conflict": "Electoral system dispute", "sentiment": "Tense", "tags": ["International Relations", "Diplomacy"]}。这种极简的结构化数据,在后续喂给个人知识库(如 Notion 或 Obsidian)时,可以通过数据库标签快速检索,而不是在成百上千篇总结文章里用关键词搜索。
在实际部署这个流程时,我踩过最大的一个坑是 AI 的“过度推演”。很多模型(尤其是参数量大的模型)在看到特定国家或政治人物时,会自动调用训练集里的背景知识进行脑补。比如在处理巴西签证事件时,如果指令不够严谨,AI 可能会自行分析两国近十年的外交关系,导致输出结果里混入了大量原文中根本没有的推论。
为了解决这个问题,我在 System Prompt 中加入了一行极其强硬的约束:Strictly adhere to the provided text, do not hallucinate background information.(严格遵守提供文本,禁止幻觉化背景信息)。只有在指令中明确切断 AI 的“联想能力”,它才能真正成为一个高效的过滤器,而不是一个自以为是的评论员。
如果你想把这个流程规模化,我建议不要在对话框里手动操作,而是利用 Dify 或 Coze 搭建一个简单的 AI Agent。具体的链路是:通过 RSS 订阅源抓取国际资讯 → 触发 Agent 运行上述 JSON 提取 Prompt → 通过 Webhook 将结构化数据推送到 Notion 页面。
这样操作后的体感变化非常明显:以前我需要花一小时刷各种新闻 App,在海量的信息噪音里筛选关键点;现在我每天只需要打开 Notion,看一眼被 Agent 过滤后的“冲突点清单”,就能迅速掌握全球局势的动态。这种将 AI 视为“数据清洗层”而非“阅读助手”的思路,才是提升信息处理效率的核心。
这网页加载慢得离谱,点进去转圈圈转了快一分钟,现在的广告插件真是要把人搞崩溃。