分享一个全球AI API延迟实时监测工具
很多做AI应用的开发者都懂,TTFT(首字响应时间)直接决定了产品的“呼吸感”。如果响应慢了半秒,用户感知到的就是“卡顿”而不是“思考”。但最蛋疼的是,你想知道某个模型在特定区域(比如东京或法兰克福)的真实延迟时,根本找不到独立且实时的第三方数据,厂商给的status page基本只能看个大概。
这种做法有个意外的收获,就是强制我把页面做得极简,结果在Cloudflare的“Agent-Ready”检测中拿到了Level 5最高分,Lighthouse跑分也是满分。
下一篇
用AI读长篇协议比自己死磕快得多 →
所以我自己搞了一个 LLM Latency Tracker,专门盯着全球各地的API延迟和可用性。
这个工具的逻辑很简单:不抓取现成数据,而是直接测。我写了一个Python探测脚本,分布在德国、美国中部、东京和圣保罗四个节点。它会把整个链路拆开测:DNS解析 → TCP连接 → TLS握手 → TTFB(首字节时间)。这样就能分清楚到底是网络链路慢,还是模型排队慢。
目前它覆盖了大约45个供应商,除了OpenAI、Anthropic这些大厂,还把DeepSeek、Qwen、Kimi这些国产大模型也加进去了,这在很多国外榜单里是看不到的。
最硬核的地方在于我把它做成了“Agent-Native”。现在很多数据被包裹在复杂的JS里,AI Agent根本读不到。为了让模型能直接调用这些延迟数据,我做了几件事:
- 部署了MCP服务器:在
/mcp路径提供get_ai_api_latency工具,Agent可以直接调用获取结构化数据。 - 适配llms.txt:给模型提供一个清晰的站点地图。
- 支持Markdown内容协商:请求
text/markdown就能拿到干净的文档,不用去解析DOM。
这种做法有个意外的收获,就是强制我把页面做得极简,结果在Cloudflare的“Agent-Ready”检测中拿到了Level 5最高分,Lighthouse跑分也是满分。
如果你在做多模型路由或者需要根据地域选择最快供应商,这个方案非常实用。核心探测逻辑可以用简单的 Python 实现,感兴趣的可以参考这个链路:
# 核心探测逻辑伪代码
import time
import socket
def measure_latency(endpoint):
start = time.perf_counter()
# 1. DNS Resolution
# 2. TCP Connect
# 3. TLS Handshake
# 4. TTFB (Time to First Byte)
# 记录每个阶段的耗时
return latency_metrics整个项目基于 SQLite 存储,通过静态站点生成器发布在 Cloudflare Pages 上,完全自动化运行,不需要维护复杂的后端。