LLM Proxy:解决 SSE 流式传输超时的小工具
很多大模型接口在流式输出(SSE)时,如果中间停顿稍微久一点,前端或者中间层网关就直接报 Timeout 掐断连接,这事儿极其烦人。LLM Proxy 这个 Python 项目的逻辑很简单:它在中间做一层聚合,通过维持心跳或优化流处理来防止这种不必要的连接中断。
下一篇
AI时代的笔记法:我的工具链与逻辑 →
对于需要自建 AI Agent 工作流或者在不稳定网络环境下调用大模型的人来说,这玩意儿比自己去写复杂的 Keep-alive 逻辑要快得多。
上手部署挺简单的:
一、安装依赖
pip install llmproxy二、启动代理
llmproxy --api-key YOUR_API_KEY --model gpt-4o三、调用方式
启动后,你只需要把原本请求大模型 API 的 Base URL 改成这个代理地址(默认 localhost:8000),剩下的流式聚合和超时处理它在后台自动搞定。
虽然它目前功能比较单一,但这种“小而美”的工具正好解决了实战中一个很具体的痛点。不过我比较好奇的是,在高并发场景下,这种聚合机制会不会反而增加延迟,或者在处理超长文本时是否会出现内存堆积,这得在实际业务压力测试后才能得出结论。