我手搓了一个 K8s 原生多模态推理平台
标题有点长,干说一圈,核心意思是这样:
他们干了一件很多团队都想干但懒得做的事:把这些杂活封装进一个平台,并顺便套了一层 K8s 的原生管理能力。
支持环境包括本地 RKE2 集群,以及 EKS / GKE / AKS。
不过问题也不少:
如果你最近正苦恼“怎么在 K8s 上跑 LLM 集群”,可以去试试看。
> 一个开源项目,名字叫 Shaide,目标是让你能在自己的 K8s 集群里,跑多个 LLM,支持自动扩缩容、智能调度、离线部署全套一站式搞定。
我不是 co-founder,但看完介绍后脑子里蹦出几个问题:
这是怎么玩的?
作者说起初只想跑一个模型,但很快遇见人人遇见的问题:
- 多个模型一起跑 → 怎么路由?
- 每个模型独立扩缩容 → K8s 怎么知道谁要扩?
- KV cache 命中率低 → 怎么调度?
- 环境一致性 → IaC 固化配置?
他们干了一件很多团队都想干但懒得做的事:把这些杂活封装进一个平台,并顺便套了一层 K8s 的原生管理能力。
架构零散记一下:
- vLLM 负责单模型推理
- llm-d 负责多实例编排(这个组件听说是英伟达搞的?)
- KV-cache-aware scheduler 调度策略
- 内置一个 OCI registry 存镜像 + 模型权重
- 提供 OpenAI 兼容 API
- 使用 IaC 管理所有资源
- 安装方式是从 Docker 启动一个交互式安装器,对接已有集群
- 支持 完全离线部署,无集群外网访问需求
支持环境包括本地 RKE2 集群,以及 EKS / GKE / AKS。
我的观察
这玩意儿看起来像是在做一个「K8s 上的大模型运行时」,类似 Ray 或 Seldon,但更聚焦于推理阶段。
优点明显:
- 原生 K8s,不额外引入编排系统
- 离线部署友好,适合有安全要求的场景
- OpenAI 兼容,迁移成本低
不过问题也不少:
- 项目刚开源没多久,社区反馈有限
- 文档和例子估计还少
- 多模型调度逻辑是否足够智能还有待验证
谁可能会用到?
- 有自己的 GPU 集群想跑多个模型的团队
- 希望脱离云厂商但又不想手搓调度逻辑的人
- 正在评估 vLLM + K8s 组合的 infra 工程师
如果你最近正苦恼“怎么在 K8s 上跑 LLM 集群”,可以去试试看。
项目地址:https://github.com/axemcloud/shaide
是 Apache 2.0 协议,欢迎 PR 和 issue。
事件追踪 · 相关报道
通义千问 3.8 那个 27B 的模型居然能在这个量级把 3.
16天前
我把服务挂了快五个小时,结果一个请求都没接住
21天前
开源AI基础设施扔进生产环境,和demo完全是两码事。
28天前
闲置GPU就是停在地上的飞机?聊聊算力池子里被浪费的钱
2026/7/31
开源权重模型已经足够好:从代码生成聊到本地化部署
2026/7/30
免费 AI 工具箱 · 全部完全免费