分享一个全球AI API延迟实时监测工具

小Ray在路上 中级 9小时前 520 浏览 14 点赞 约 2 分钟

很多做AI应用的开发者都懂,TTFT(首字响应时间)直接决定了产品的“呼吸感”。如果响应慢了半秒,用户感知到的就是“卡顿”而不是“思考”。但最蛋疼的是,你想知道某个模型在特定区域(比如东京或法兰克福)的真实延迟时,根本找不到独立且实时的第三方数据,厂商给的status page基本只能看个大概。

所以我自己搞了一个 LLM Latency Tracker,专门盯着全球各地的API延迟和可用性。

这个工具的逻辑很简单:不抓取现成数据,而是直接测。我写了一个Python探测脚本,分布在德国、美国中部、东京和圣保罗四个节点。它会把整个链路拆开测:DNS解析 → TCP连接 → TLS握手 → TTFB(首字节时间)。这样就能分清楚到底是网络链路慢,还是模型排队慢。

目前它覆盖了大约45个供应商,除了OpenAI、Anthropic这些大厂,还把DeepSeek、Qwen、Kimi这些国产大模型也加进去了,这在很多国外榜单里是看不到的。

最硬核的地方在于我把它做成了“Agent-Native”。现在很多数据被包裹在复杂的JS里,AI Agent根本读不到。为了让模型能直接调用这些延迟数据,我做了几件事:

  • 部署了MCP服务器:在 /mcp 路径提供 get_ai_api_latency 工具,Agent可以直接调用获取结构化数据。
  • 适配llms.txt:给模型提供一个清晰的站点地图。
  • 支持Markdown内容协商:请求 text/markdown 就能拿到干净的文档,不用去解析DOM。

这种做法有个意外的收获,就是强制我把页面做得极简,结果在Cloudflare的“Agent-Ready”检测中拿到了Level 5最高分,Lighthouse跑分也是满分。

如果你在做多模型路由或者需要根据地域选择最快供应商,这个方案非常实用。核心探测逻辑可以用简单的 Python 实现,感兴趣的可以参考这个链路:

# 核心探测逻辑伪代码
import time
import socket

def measure_latency(endpoint):
    start = time.perf_counter()
    # 1. DNS Resolution
    # 2. TCP Connect
    # 3. TLS Handshake
    # 4. TTFB (Time to First Byte)
    # 记录每个阶段的耗时
    return latency_metrics

整个项目基于 SQLite 存储,通过静态站点生成器发布在 Cloudflare Pages 上,完全自动化运行,不需要维护复杂的后端。

提示词AILLMPromptopensource

全部回复 (3)

强迫症脚本小子 专家 9小时前
建议加上不同并发下的延迟波动,单线程测出来的没参考意义。
0 回复
深漂独立开发者 中级 9小时前
这个能看不同模型对比吗?想知道哪个区现在最稳。
0 回复
全栈小李 高级 9小时前
确实,之前在新加坡节点被卡死过,得有这种工具盯着才行。
0 回复

发表回复

支持 Markdown 格式