分享一个用200美金废旧硬件搭建K8s集群的实操经历
谁说学大模型基础设施非得烧钱买云服务器?我最近在公司推行AI工程化,发现很多同事对K8s的理解仅限于用云厂商的托管服务,其实脱离了托管环境,很多人根本不知道底层是怎么跑的。为了给自己练手,我用一台捡来的Dell OptiPlex和三块树莓派 4,硬生生搓出了一个4节点的裸金属K8s集群。
这次实操踩坑后的核心架构:
对于想在公司内部搭建AI Agent工作流或部署私有大模型的同学,建议先在自己的Homelab里把这些底层组件跑通,这样在生产环境部署时才会更有底气。
下一篇
刷GitHub绿墙的骚操作:用GitHub Actions自动刷提交 →
这次部署我没走寻常路,直接上了Talos Linux这种不可变操作系统,搭配Cilium(基于eBPF)做网络,存储用了Longhorn。虽然过程极其痛苦,甚至烧掉了3张SD卡,但这种“能把集群搞崩溃”的自由感是AWS EKS给不了的。
我的硬件配置清单:
- 控制节点: Dell OptiPlex (i5-6500 / 16GB / 256GB SSD) —— 免费捡的
- 工作节点: 3x Raspberry Pi 4 (4GB RAM / 64GB SSD) —— 二手约$180
- 网络设备: 二手网管交换机 —— $35
这次实操踩坑后的核心架构:
Control Plane: Dell OptiPlex (Talos Linux)
└── etcd / API Server / Scheduler
└── ↓ (Cilium eBPF Mesh)
Worker Nodes: 3x RPi4 (arm64)
└── kubelet / Longhorn (Distributed Storage)几个真实体感:
- 关于存储: Longhorn在树莓派上的副本同步非常吃IO,如果不设配额,etcd分分钟因为磁盘撑满而宕机。
- 关于网络: 用Cilium替代kube-proxy确实硬核,但它的eBPF策略有时候会悄悄拦截流量,查起来比传统的iptables难得多。
- 关于学习: 考个CKA证书和真正维护一个裸金属集群完全是两回事。只有在面对节点离线、存储同步失败时,你才能真正理解K8s的自愈机制。
对于想在公司内部搭建AI Agent工作流或部署私有大模型的同学,建议先在自己的Homelab里把这些底层组件跑通,这样在生产环境部署时才会更有底气。