开源AI基础设施扔进生产环境,和demo完全是两码事。

PromptCube 专家 1小时前 644 浏览 13 点赞 约 2 分钟

我自己现在跑着的组合是:推理用vLLM + Triton,编排就K8s + KubeFlow,向量库用的Milvus,可观测性直接上Prometheus + Grafana全家桶,数据管道是Airflow在撑。这套组合的好处是每个组件社区都很活跃,坏了能找到人问,坏处是每个组件都得自己伺候。

我现在的态度是:核心负载自己运维,边缘场景直接买托管服务。比如向量搜索这种,自己搭Milvus集群维护成本真心不低,如果业务量没到那个级别,用云上的Pinecone或者Zilliz完全够用;但推理服务这种直接决定产品体验的东西,我还是倾向自己控,vLLM的调度参数、continuous batching的配置,托管服务给不了那么细的粒度。

已经弃坑过两个:一个是当年想省事用的某个"全栈AI平台",抽象层次太高,出问题根本不知道底层发生了什么;另一个是自建的Feature Store,数据量上来之后运维成本爆炸,后来直接用PostgreSQL + Redis硬扛了。教训就是小众基础设施工具,别碰

过了原型阶段才会暴露的问题,我觉得最典型的是这几类:

1. 模型版本管理。demo阶段加载个模型就完事,生产环境你得上模型注册、灰度、回滚,这个工作量大到你想骂人。
2. 可观测性从"看日志"变成"看指标"。延迟、吞吐、GPU利用率、队列积压,每一个都要单独盯,而且这些指标之间还有关联。
3. 成本失控。没人告诉你GPU占用的碎片的钱有多烧,你得做request-level的计费才能看清楚是谁在浪费。

如果能重来,我不会再追求组件越新越好。基础设施的选型标准应该是无聊、稳定、文档全,而不是Github星星多。

我也在纠结一个问题:现在MCP这套东西火得不行,但真正敢把MCP server跑进生产的团队有多少?感觉适合做POC的场景,离扛住线上流量还有一段距离。你们有在production用MCP吗?还是只在内部工具里玩?

mcpvLLMMilvusK8sKubeFlow
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。

全部回复 (3)

架构师老刘 中级 1小时前
说到点子上了,监控告警半夜响起来那会儿才真叫伺候祖宗。
0 回复
数据分析师Neo 专家 1小时前
我那个vLLM部署时老爆显存,后来发现是paged attention参数没调对。
0 回复
摸鱼攻城狮 初级 1小时前
上次自己搭的推理服务压测一跑就崩,折腾三天才明白是配置问题。
0 回复

发表回复

支持 Markdown 格式