我手搓了一个 K8s 原生多模态推理平台

PromptCube 高级 1小时前 651 浏览 1 点赞 约 1 分钟

标题有点长,干说一圈,核心意思是这样:

> 一个开源项目,名字叫 Shaide,目标是让你能在自己的 K8s 集群里,跑多个 LLM,支持自动扩缩容、智能调度、离线部署全套一站式搞定。

我不是 co-founder,但看完介绍后脑子里蹦出几个问题:


这是怎么玩的?

作者说起初只想跑一个模型,但很快遇见人人遇见的问题:

  • 多个模型一起跑 → 怎么路由?
  • 每个模型独立扩缩容 → K8s 怎么知道谁要扩?
  • KV cache 命中率低 → 怎么调度?
  • 环境一致性 → IaC 固化配置?

他们干了一件很多团队都想干但懒得做的事:把这些杂活封装进一个平台,并顺便套了一层 K8s 的原生管理能力。


架构零散记一下:

  • vLLM 负责单模型推理
  • llm-d 负责多实例编排(这个组件听说是英伟达搞的?)
  • KV-cache-aware scheduler 调度策略
  • 内置一个 OCI registry 存镜像 + 模型权重
  • 提供 OpenAI 兼容 API
  • 使用 IaC 管理所有资源
  • 安装方式是从 Docker 启动一个交互式安装器,对接已有集群
  • 支持 完全离线部署,无集群外网访问需求

支持环境包括本地 RKE2 集群,以及 EKS / GKE / AKS。


我的观察

这玩意儿看起来像是在做一个「K8s 上的大模型运行时」,类似 Ray 或 Seldon,但更聚焦于推理阶段。

优点明显:

  • 原生 K8s,不额外引入编排系统
  • 离线部署友好,适合有安全要求的场景
  • OpenAI 兼容,迁移成本低

不过问题也不少:

  • 项目刚开源没多久,社区反馈有限
  • 文档和例子估计还少
  • 多模型调度逻辑是否足够智能还有待验证


谁可能会用到?

  • 有自己的 GPU 集群想跑多个模型的团队
  • 希望脱离云厂商但又不想手搓调度逻辑的人
  • 正在评估 vLLM + K8s 组合的 infra 工程师

如果你最近正苦恼“怎么在 K8s 上跑 LLM 集群”,可以去试试看。


项目地址:https://github.com/axemcloud/shaide
是 Apache 2.0 协议,欢迎 PR 和 issue。

kubernetesvLLMShaideaxemllm-d

全部回复 (3)

老大鹏 专家 1小时前
要是能把冷启动时间压下来就更好了,不然扩容太慢等不及。
0 回复
咖啡续命折腾党 中级 1小时前
这玩意儿对显存碎片化处理得怎么样?扩容时会不会导致OOM?
0 回复
养生全栈 中级 1小时前
之前带队部署也遇到过,多模型切来切去显存调度确实头大,看你怎么解。
0 回复

发表回复

支持 Markdown 格式