模型路由正在悄悄变成多模型时代的控制平面

折腾党小雨 中级 1小时前 795 浏览 5 点赞 约 3 分钟

大家还在争哪个模型最聪明,生产环境早就面临另一个问题:几百个模型怎么管。

去年上线一个客服系统,单月 Token 账单跑到两万刀。复盘发现:80% 的请求只是问「怎么重置密码」「发票在哪」,全丢给 GPT-4o 处理。把这部分切到 Haiku 3.5,成本直接砍掉 65%,用户体感零差异。

这就是路由层的价值——不是网关,是能看懂上下文的优化引擎。

一、单模型时代早结束了

真实的生产架构长这样:

应用层
   ↓
路由层(决策:任务类型、成本预算、合规要求、SLA)
   ↓
├── 推理模型(o1、DeepSeek-R1)处理复杂推理
├── 速度模型(Haiku、Flash)处理实时交互
├── 私有部署(Llama、Qwen)处理敏感数据
└── 兜底模型(备用供应商)应对断供

难点不在「怎么调 API」,而在「怎么根据请求特征、历史表现、实时价格、可用性,动态做最优决策」。

二、Token 正在变成新的云资源

以前管 CPU、内存、数据库连接数;现在得管:

  • Token 消耗曲线(按模型、按业务线拆解)
  • 单位任务成本(不是单价,是完成一个工单/一次对话的总成本)
  • 延迟分位数(P50/P95/P99,不同模型差异巨大)
  • 失败率与重试开销(供应商抖动时的连锁反应)
  • 合规路由比例(有多少流量被强制导向私有部署)

我们在 Grafana 里建了个「模型成本仪表盘」,每天早会第一件事就是看:昨天哪个模型的性价比倒挂了。

三、路由策略不是写死的 if-else

最开始我们硬编码:关键词匹配「投诉」走强模型,「查询」走弱模型。上线两周发现误判率 23%。

后来改成:轻量分类器 + 上下文特征 + 在线学习

分类器只有 50MB,推理 8ms,输入是:用户最近 3 轮对话摘要 + 实体识别结果 + 业务标签。输出是概率分布,路由层结合当前各模型的实时价格、延迟、可用性,跑一个简单的线性规划,算出当下的最优分配。

上线后,强模型调用占比从 100% 降到 34%,人工复核率从 12% 降到 4%(强模型推理更准,少了幻觉)。

四、别被「最便宜」忽悠

成本公式不是 价格 × Token,而是:

总成本 = 模型调用成本 + 人工兜底成本 + 错误导致的业务损失 + 迁移锁定风险

我们算过一笔账:把代码生成任务从 GPT-4o 降级到某 7B 开源模型,Token 成本省 90%,但人工 Review 时间从 2 分钟涨到 15 分钟,折合人力成本反而多了 3 倍。

现在的策略:核心业务路径(下单、支付、合同生成)锁死顶配模型;探索性、容错率高的场景(文案润色、摘要、闲聊)激进压成本。

五、锁定才是最大的隐性成本

OpenRouter 被 Stripe 收购不是巧合。支付公司最懂「路由」——同样的交易,走 Visa 还是 Mastercard 还是本地网络,取决于费率、成功率、结算周期。

模型层也一样。现在不做路由层,等供应商涨价、断供、下线模型时,重写业务代码的成本比现在搭路由层高两个数量级。


我们现在的路由层大概 2000 行 Go 代码,接了 12 个上游,支撑日均 300 万请求。核心逻辑就三块:画像分类、实时评分、熔断降级

想看具体实现细节的,评论区说一声,我整理份配置模板发出来。

StripeOpenRouter模型路由多模型架构生产环境优化

全部回复 (4)

副业中创业者 初级 1小时前
路由规则是靠关键词匹配,还是另跑个小模型做分类?
0 回复
阿Sam的日常 高级 1小时前
关键词太死板吧,语义理解靠它肯定漏判不少,小模型分类倒靠谱但延迟怎么压?
0 回复
小Kevin在路上 中级 1小时前
我们加了语义缓存层,重复问答直接拦截,成本再砍三成
0 回复
躺平产品经理 初级 1小时前
我们这边直接上兜底链,主模型挂了自动切备选,半夜不敢睡死觉
0 回复

发表回复

支持 Markdown 格式