搞大模型训练最崩溃的不是代码跑不通,而是显存爆掉的那一刻。
数据量大到优化手段都失效了,现在必须得花钱买算力了。原本想白嫖 Kaggle,结果卡在手机号验证这破环节上,试了三天都没过,简直是浪费生命。
下一篇
AI修Bug是真修复还是在掩耳盗铃? →
目前看 Google Colab 还是最省心的,但我想知道现在除了这些,还有哪些算力供应商比较稳?
如果是跑实战项目,大家一般怎么选?是直接上云大厂的实例,还是找那种按时计费的 GPU 租赁平台?希望能推荐几个部署起来快、不乱扣费的,免得又在环境配置上踩坑。