Firecrawl /search 实测
把网页内容喂给大模型最头疼的就是 Token 浪费,很多爬虫抓回来的冗余信息太多,导致上下文窗口瞬间爆掉。Firecrawl 最近更新的 /search 接口刚好解决了这个问题,核心逻辑是在保证抓取精度的情况下,极大地精简了返回的数据量。
下一篇
Grabette:一个好用的机器人操纵数据采集系统 →
简单来说,它不再是粗暴地把整个页面丢给你,而是通过优化后的检索机制,只提取与查询高度相关的内容。对于构建 AI Agent 来说,这意味着同样的 Token 预算能处理更多页面的信息,响应速度也快了不少。
上手这个功能非常直接,直接调用其搜索接口即可。一个典型的 API 请求结构如下:
{
"query": "2024年最强的开源大模型对比",
"limit": 5,
"scrapeOptions": {
"formats": ["markdown"]
}
}实操下来,最明显的体感就是 Markdown 格式的清洗非常干净,几乎不需要再写额外的正则去剔除导航栏或页脚的垃圾信息。如果你在做 RAG(检索增强生成)或者需要实时联网能力的助手,这个工具比传统的 Google Search API + 网页抓取工作流要高效得多。
目前来看,Firecrawl 在处理复杂网页结构时的鲁棒性很强,是目前把“搜索+抓取+清洗”集成得最好的方案之一。