在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里

小李爱学习 初级 1小时前 470 浏览 7 点赞 约 2 分钟

如果你在跑 Coursera 的 Generative AI with Large Language Models 课程,启动 SageMaker Studio Space 时突然弹窗报错,大概率是遇到了 AWS 的实例容量问题,而且由于课程环境的权限限制,你可能根本没法自己通过修改配置来解决。

遇到 EC2InsufficientCapacityError 怎么办

最直接的报错信息是:
EC2InsufficientCapacityError: Instance type 'ml.m5.2xlarge' is temporarily unavailable in supported availability zones [use1-az1]. Try again in a few minutes, or try a different instance type.

这个错误的意思很简单:在 us-east-1 区域的 use1-az1 可用区里,ml.m5.2xlarge 这种规格的机器暂时被抢光了。这在 AWS 的公共区域非常常见,尤其是像 Coursera 这种大量学生同时涌入的课程环境下,某个时段请求量暴增,资源池就会瞬间见底。

在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里

在这种情况下,通常有两种处理路径:
第一种是死磕,每隔几分钟点一次启动,赌运气等 AWS 释放出机器。
第二种是尝试更换实例类型,比如换一个稍微大一点或小一点的规格。

为什么尝试修改实例类型会报权限错误

很多人的本能反应是既然 ml.m5.2xlarge 没货,那就换个型号。但在 Coursera 提供的托管环境中,你经常会撞上这个权限报错:
not authorized to perform: sagemaker:UpdateSpace ... with an explicit deny in an identity-based policy

在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里

这说明 Coursera 给你的 IAM 角色设置了「显式拒绝(Explicit Deny)」。在 AWS 的权限逻辑里,Explicit Deny 的优先级最高,不管你拥有多少 Allow 权限,只要这里写了 Deny,你就无法执行 sagemaker:UpdateSpace 操作。

这意味着你无法在控制台自行更改实例规格。这种设计是为了统一课程环境,防止学生随意升级到昂贵的 GPU 实例导致成本失控,但副作用就是当默认实例缺货时,学生完全失去了自救能力。

针对此问题的具体排查与结论

在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里

根据目前的实测情况,针对这三个疑问的判断如下:

  • 是否是临时容量问题?
在 Coursera 跑 Generative AI 课程时遇到 SageMaker Studio 启动失败,大概率是掉进了 AWS 资源不足的坑里
是的,这是典型的 AWS 资源调度问题。由于报错明确指出了 use1-az1 区域不可用,这与你的代码或配置无关,纯粹是云端没机器了。
  • 是否有推荐的替代实例?
虽然 ml.m5.2xlarge 是课程默认配置,但因为你被限制了 UpdateSpace 权限,即便知道了替代型号(比如其他 m5 系列或 m6i 系列),你也无法在当前账号下手动切换。
  • 权限是否需要管理员修改?
是的。如果你发现连续几个小时都无法启动,且必须更换实例才能继续实验,那么唯一的解决办法是联系 Coursera 的课程管理员或提交 Ticket,让他们在后台调整该 Space 的实例类型或放开权限。

总结操作建议

如果你现在被卡住了,建议的操作顺序是:
1. 刷新页面,尝试重新启动 Space,重复 3-5 次。
2. 如果依然报错,不要在权限受限的控制台浪费时间尝试修改配置,直接在课程论坛发帖或联系技术支持,告知对方 us-east-1ml.m5.2xlarge 缺货且你没有 UpdateSpace 权限。

awsCourseraSageMakerEC2

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

全栈小李 高级 1小时前

这ml.m5.2xlarge简直是噩梦,我上次卡在use1-az1等了半小时,最后还是重启整个Lab才进去的。

0 回复
老陈 专家 58分钟前

这ml.m5.2xlarge真是坑死人,我上次死磕这个报错两小时,最后发现只能等天亮才刷出来。

0 回复
深漂独立开发者 中级 56分钟前

这 ml.m5.2xlarge 资源这么紧缺吗?我想知道除了死等,换个可用区能绕过去不。

0 回复

发表回复

支持 Markdown 格式