在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里
如果你在跑 Coursera 的 Generative AI with Large Language Models 课程,启动 SageMaker Studio Space 时突然弹窗报错,大概率是遇到了 AWS 的实例容量问题,而且由于课程环境的权限限制,你可能根本没法自己通过修改配置来解决。
遇到 EC2InsufficientCapacityError 怎么办
最直接的报错信息是:EC2InsufficientCapacityError: Instance type 'ml.m5.2xlarge' is temporarily unavailable in supported availability zones [use1-az1]. Try again in a few minutes, or try a different instance type.
这个错误的意思很简单:在 us-east-1 区域的 use1-az1 可用区里,ml.m5.2xlarge 这种规格的机器暂时被抢光了。这在 AWS 的公共区域非常常见,尤其是像 Coursera 这种大量学生同时涌入的课程环境下,某个时段请求量暴增,资源池就会瞬间见底。
在这种情况下,通常有两种处理路径:
第一种是死磕,每隔几分钟点一次启动,赌运气等 AWS 释放出机器。
第二种是尝试更换实例类型,比如换一个稍微大一点或小一点的规格。
为什么尝试修改实例类型会报权限错误
很多人的本能反应是既然 ml.m5.2xlarge 没货,那就换个型号。但在 Coursera 提供的托管环境中,你经常会撞上这个权限报错:not authorized to perform: sagemaker:UpdateSpace ... with an explicit deny in an identity-based policy
这说明 Coursera 给你的 IAM 角色设置了「显式拒绝(Explicit Deny)」。在 AWS 的权限逻辑里,Explicit Deny 的优先级最高,不管你拥有多少 Allow 权限,只要这里写了 Deny,你就无法执行 sagemaker:UpdateSpace 操作。
这意味着你无法在控制台自行更改实例规格。这种设计是为了统一课程环境,防止学生随意升级到昂贵的 GPU 实例导致成本失控,但副作用就是当默认实例缺货时,学生完全失去了自救能力。
针对此问题的具体排查与结论
根据目前的实测情况,针对这三个疑问的判断如下:
- 是否是临时容量问题?
use1-az1 区域不可用,这与你的代码或配置无关,纯粹是云端没机器了。
- 是否有推荐的替代实例?
ml.m5.2xlarge 是课程默认配置,但因为你被限制了 UpdateSpace 权限,即便知道了替代型号(比如其他 m5 系列或 m6i 系列),你也无法在当前账号下手动切换。
- 权限是否需要管理员修改?
总结操作建议
如果你现在被卡住了,建议的操作顺序是:
1. 刷新页面,尝试重新启动 Space,重复 3-5 次。
2. 如果依然报错,不要在权限受限的控制台浪费时间尝试修改配置,直接在课程论坛发帖或联系技术支持,告知对方 us-east-1 的 ml.m5.2xlarge 缺货且你没有 UpdateSpace 权限。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。

这ml.m5.2xlarge简直是噩梦,我上次卡在use1-az1等了半小时,最后还是重启整个Lab才进去的。