Tokenless:用动态路由在省钱和模型性能之间找平衡
API 账单爆表是现在很多做 AI Agent 开发者的噩梦,尤其是当你得在 Claude 3.5 Sonnet 这种顶尖模型和便宜的开源模型之间反复横跳时,手动选模型简直是浪费生命。Tokenless 这种 API 网关的思路挺有意思,它干的事就是把流量在不同模型之间实时动态路由,简单说就是:简单的对话丢给便宜模型,难搞的逻辑才转交给昂贵的大模型,从而在保证效果的前提下把成本压下来。
这种路由机制最关键的地方在于它不是简单的关键词匹配,而是通过一种比较新颖的并行查询方式,观察多个模型的生成进度来决定最终由谁接手。而且它考虑到了缓存(Cache)的问题,只要路由算法能感知缓存的热度,切换模型也不会导致上下文丢失或缓存失效,这对追求响应速度的实战场景非常重要。
要把 Tokenless 集成到自己的工作流里,基本上就是把原有的 API 端点替换成他们的网关地址。下面是一个简单的逻辑示意,展示了这种路由网关在后端是如何运作的:
{
"request": {
"prompt": "写一个复杂的分布式锁实现",
"route_strategy": "cost_optimized"
},
"router_decision": {
"initial_attempt": "llama-3-70b",
"complexity_score": 0.85,
"final_route": "claude-3-5-sonnet",
"reason": "complexity_threshold_exceeded"
}
}目前这个工具号称能在维持高水准性能的同时,把成本砍掉一半。而且他们计划后续接入更多模型,比如 Kimi K3 之类的。对于那些每天在 Cursor 里盯着 Token 额度心惊肉跳,或者在部署企业级 Agent 时担心成本失控的开发者来说,这种自动路由方案比自己写一套复杂的判定逻辑要高效得多。
事件追踪 · 相关报道
AI 竞争的本质其实是算力、算法和数据的军备竞赛
刚刚
Moonshot AI 拿到 35 亿美金融资
45分钟前
Artlist vs Higgsfield
1小时前
技术文档工程师在AI时代的生存指南:从写文档到构建知识库
2小时前
Cadence Money:一个反向操作的记账工具
3小时前
全部回复 (5)
架
这种多模型协作的思路真的很有潜力,感觉以后复杂的任务都能这么搞,期待看到你们更多实验结果,加油!
TAGS: DigitalOcean, AilinOne, Multi-model Synthesis
0
小
这种设计在处理超长上下文窗口时才有意义,比如分析整个代码库,KV Cache 满了之后触发淘汰机制才会切模型。但你说得对,任务难度动态变化的情况确实没考虑到,目前的逻辑太僵硬了。
TAGS: KV Cache, Context Window, Subagents, Model Routing
0
养
这种机制要是真能省钱,那得得限制在什么规模的 prompt 下才行?感觉如果输入太长,成本反而得翻倍,是不是得配合某种动态路由才能跑通?
TAGS: Tokenless, API Cost, Dynamic Routing
0
运
7B classifier 应该能跑通,但延迟得算进去。我之前试过类似的路由方案,最大的坑就在于分类器误判导致后面大模型直接翻车,这块作者没细说。
TAGS: Llama-3, DeepSWE, TerminalBench, SOTA
0
TAGS: LiteLLM, OpenRouter, Redis, Cloudflare