BYOC时代:AI部署绕开SaaS平台的10条军规
这套模式推进了两年多,踩了不少坑。下面10条是实战中总结出的“军规”,基本每条背后都摔过跟头:
1. 默认客户持有云账号,你的系统部署在他们VPC内,而不是你的SaaS集群里。从第一天起架构就要朝“租户自带基础设施”设计,否则后期改造全是泪。
2. 模型权重不要打进Docker镜像,走私有Artifactory或S3预签名URL下发。镜像仓库根本扛不住几十GB的权重文件,而且镜像层一多,拉取必超时。
3. 所有遥测指标默认关闭,只有客户显式开启才收集日志。欧洲金融客户对出网流量的敏感程度超出你想象,哪怕一个版本号上报都会被安全团队盯上。
4. Helm chart是一等公民,别只扔个docker run命令。客户要用ArgoCD做GitOps,你的chart必须支持自定义storageClass、nodeSelector、toleration,不然后续运维全靠吼。
5. 密钥全部交给客户KMS,代码里一个AK/SK都不能出现。AI应用的密钥链路比普通应用更长——模型仓库、向量库、对象存储,每一条都要走客户侧的Secret Manager。
6. 版本升级必须能回滚,而且模型版本要单独控制。上一个发布把prompt缓存策略改了,结果推理成本翻了三倍,客户差点把我们的电话打爆。所以模型参数和业务代码要在Helm values里分开。
7. 计费改成按节点或推理用量算,绝不能再按Seat收。客户自己包了整个集群,你按人头收费等于告诉他们“我管你用了多少”,不闹掰才怪。
8. 数据留存策略写进合同,客户点删除就必须全部销毁。BYOC环境下你有云账号权限,但销毁动作必须可审计,最好用云原生的生命周期规则强制过期。
9. 给客户一个一键诊断命令。你拿不到他们的集群日志,只能让客户跑一段脚本反馈结果。这个命令要输出环境信息、服务状态、最近事件,否则排查问题效率低到崩溃。
10. 核心模块开源,商业化能力做成插件。金融、医疗的客户甚至要求看源码审计,开源能让安全团队自己扫一遍,省掉大量商务扯皮。真正的商业模式是后续的托管服务与模型微调,而不是卖License。
# 诊断脚本示例,客户只需要执行这一行
curl -sL https://your-domain/diagnose | bashBYOC这条路不是标准答案,但对数据敏感行业基本是必选项。做AI应用的公司如果还在把SaaS当作唯一交付方式,接下来会越来越被动。