分享一个用200美金废旧硬件搭建K8s集群的实操经历

架构师Neo 中级 6小时前 更新于 2026年7月26日 187 浏览 2 点赞 约 1 分钟

谁说学大模型基础设施非得烧钱买云服务器?我最近在公司推行AI工程化,发现很多同事对K8s的理解仅限于用云厂商的托管服务,其实脱离了托管环境,很多人根本不知道底层是怎么跑的。为了给自己练手,我用一台捡来的Dell OptiPlex和三块树莓派 4,硬生生搓出了一个4节点的裸金属K8s集群。

这次部署我没走寻常路,直接上了Talos Linux这种不可变操作系统,搭配Cilium(基于eBPF)做网络,存储用了Longhorn。虽然过程极其痛苦,甚至烧掉了3张SD卡,但这种“能把集群搞崩溃”的自由感是AWS EKS给不了的。

我的硬件配置清单:

  • 控制节点: Dell OptiPlex (i5-6500 / 16GB / 256GB SSD) —— 免费捡的
  • 工作节点: 3x Raspberry Pi 4 (4GB RAM / 64GB SSD) —— 二手约$180
  • 网络设备: 二手网管交换机 —— $35

这次实操踩坑后的核心架构:

Control Plane: Dell OptiPlex (Talos Linux)
  └── etcd / API Server / Scheduler
      └── ↓ (Cilium eBPF Mesh)
Worker Nodes: 3x RPi4 (arm64)
  └── kubelet / Longhorn (Distributed Storage)

几个真实体感:

  • 关于存储: Longhorn在树莓派上的副本同步非常吃IO,如果不设配额,etcd分分钟因为磁盘撑满而宕机。
  • 关于网络: 用Cilium替代kube-proxy确实硬核,但它的eBPF策略有时候会悄悄拦截流量,查起来比传统的iptables难得多。
  • 关于学习: 考个CKA证书和真正维护一个裸金属集群完全是两回事。只有在面对节点离线、存储同步失败时,你才能真正理解K8s的自愈机制。

对于想在公司内部搭建AI Agent工作流或部署私有大模型的同学,建议先在自己的Homelab里把这些底层组件跑通,这样在生产环境部署时才会更有底气。
工作流AI落地devopskuberneteshomelab

全部回复 (3)

阿福在路上 高级 10小时前
我也试过这种,建议加个小风扇,夏天散热压力真挺大的。
0 回复
脚本小子阿强 初级 10小时前
Talos虽然快,但出问题很难调试,没个好文档根本没法排坑。
0 回复
早八人AI炼丹师 专家 10小时前
以前用旧笔记本攒过集群,确实比用云平台理解得深。
0 回复

发表回复

支持 Markdown 格式