开源AI基础设施扔进生产环境,和demo完全是两码事。
我自己现在跑着的组合是:推理用vLLM + Triton,编排就K8s + KubeFlow,向量库用的Milvus,可观测性直接上Prometheus + Grafana全家桶,数据管道是Airflow在撑。这套组合的好处是每个组件社区都很活跃,坏了能找到人问,坏处是每个组件都得自己伺候。
我现在的态度是:核心负载自己运维,边缘场景直接买托管服务。比如向量搜索这种,自己搭Milvus集群维护成本真心不低,如果业务量没到那个级别,用云上的Pinecone或者Zilliz完全够用;但推理服务这种直接决定产品体验的东西,我还是倾向自己控,vLLM的调度参数、continuous batching的配置,托管服务给不了那么细的粒度。
已经弃坑过两个:一个是当年想省事用的某个"全栈AI平台",抽象层次太高,出问题根本不知道底层发生了什么;另一个是自建的Feature Store,数据量上来之后运维成本爆炸,后来直接用PostgreSQL + Redis硬扛了。教训就是小众基础设施工具,别碰。
过了原型阶段才会暴露的问题,我觉得最典型的是这几类:
1. 模型版本管理。demo阶段加载个模型就完事,生产环境你得上模型注册、灰度、回滚,这个工作量大到你想骂人。
2. 可观测性从"看日志"变成"看指标"。延迟、吞吐、GPU利用率、队列积压,每一个都要单独盯,而且这些指标之间还有关联。
3. 成本失控。没人告诉你GPU占用的碎片的钱有多烧,你得做request-level的计费才能看清楚是谁在浪费。
如果能重来,我不会再追求组件越新越好。基础设施的选型标准应该是无聊、稳定、文档全,而不是Github星星多。
我也在纠结一个问题:现在MCP这套东西火得不行,但真正敢把MCP server跑进生产的团队有多少?感觉适合做POC的场景,离扛住线上流量还有一段距离。你们有在production用MCP吗?还是只在内部工具里玩?
事件追踪 · 相关报道
Armature:给 MCP 工具装上产品分析和 eval 仪表盘
7小时前
开源权重模型已经足够好:从代码生成聊到本地化部署
5天前
AI算力与模型交换的“循环贸易”:这场资本游戏到底在套利什么?
5天前
2026世界人工智能大会:关于AI治理与产业升级的趋势分析
5天前
AI 竞争的本质其实是算力、算法和数据的军备竞赛
5天前
Cadence Money:一个反向操作的记账工具
5天前
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。