模型路由正在悄悄变成多模型时代的控制平面
去年上线一个客服系统,单月 Token 账单跑到两万刀。复盘发现:80% 的请求只是问「怎么重置密码」「发票在哪」,全丢给 GPT-4o 处理。把这部分切到 Haiku 3.5,成本直接砍掉 65%,用户体感零差异。
这就是路由层的价值——不是网关,是能看懂上下文的优化引擎。
一、单模型时代早结束了
真实的生产架构长这样:
应用层
↓
路由层(决策:任务类型、成本预算、合规要求、SLA)
↓
├── 推理模型(o1、DeepSeek-R1)处理复杂推理
├── 速度模型(Haiku、Flash)处理实时交互
├── 私有部署(Llama、Qwen)处理敏感数据
└── 兜底模型(备用供应商)应对断供难点不在「怎么调 API」,而在「怎么根据请求特征、历史表现、实时价格、可用性,动态做最优决策」。
二、Token 正在变成新的云资源
以前管 CPU、内存、数据库连接数;现在得管:
- Token 消耗曲线(按模型、按业务线拆解)
- 单位任务成本(不是单价,是完成一个工单/一次对话的总成本)
- 延迟分位数(P50/P95/P99,不同模型差异巨大)
- 失败率与重试开销(供应商抖动时的连锁反应)
- 合规路由比例(有多少流量被强制导向私有部署)
我们在 Grafana 里建了个「模型成本仪表盘」,每天早会第一件事就是看:昨天哪个模型的性价比倒挂了。
三、路由策略不是写死的 if-else
最开始我们硬编码:关键词匹配「投诉」走强模型,「查询」走弱模型。上线两周发现误判率 23%。
后来改成:轻量分类器 + 上下文特征 + 在线学习。
分类器只有 50MB,推理 8ms,输入是:用户最近 3 轮对话摘要 + 实体识别结果 + 业务标签。输出是概率分布,路由层结合当前各模型的实时价格、延迟、可用性,跑一个简单的线性规划,算出当下的最优分配。
上线后,强模型调用占比从 100% 降到 34%,人工复核率从 12% 降到 4%(强模型推理更准,少了幻觉)。
四、别被「最便宜」忽悠
成本公式不是 价格 × Token,而是:
总成本 = 模型调用成本 + 人工兜底成本 + 错误导致的业务损失 + 迁移锁定风险我们算过一笔账:把代码生成任务从 GPT-4o 降级到某 7B 开源模型,Token 成本省 90%,但人工 Review 时间从 2 分钟涨到 15 分钟,折合人力成本反而多了 3 倍。
现在的策略:核心业务路径(下单、支付、合同生成)锁死顶配模型;探索性、容错率高的场景(文案润色、摘要、闲聊)激进压成本。
五、锁定才是最大的隐性成本
OpenRouter 被 Stripe 收购不是巧合。支付公司最懂「路由」——同样的交易,走 Visa 还是 Mastercard 还是本地网络,取决于费率、成功率、结算周期。
模型层也一样。现在不做路由层,等供应商涨价、断供、下线模型时,重写业务代码的成本比现在搭路由层高两个数量级。
我们现在的路由层大概 2000 行 Go 代码,接了 12 个上游,支撑日均 300 万请求。核心逻辑就三块:画像分类、实时评分、熔断降级。
想看具体实现细节的,评论区说一声,我整理份配置模板发出来。