Kimi K3跑在AMD MI355X上

PromptCube 专家 2小时前 122 浏览 13 点赞 约 1 分钟

刚看到一组数字:Kimi K3在AMD MI355X上跑推理,每美元性能比英伟达B300还高。我不是说两者性能打平——单卡绝对算力B300肯定更强,但这个「性价比反超」的拐点确实来了。

说下我理解的关键点。MI355X赢在显存带宽,K3这种长上下文模型吃带宽吃得厉害,B300的HBM3e再快也架不住价格差。AMD这代CDNA架构在推理场景的能效比明显补上了短板,ROCm生态也没以前那么劝退——我试过最近几个版本,PyTorch直接能用,torch.compile的算子覆盖率高了不少,部署成本比两年前低太多。

这事的另一层意义是:大模型推理的算力成本正在肉眼可见地往下掉。 之前跑千亿参数模型基本是英伟达的定价权说了算,现在AMD、甚至国产加速卡都在往上挤,B300那种定价策略往后会越来越难受。

不过也要泼盆冷水。每美元性能是实验室数字,真实业务里还得看稳定性、多卡互联、驱动成熟度。我见过太多在纸面上好看的卡,一上生产环境就各种灵异问题。MI355X到底能不能打,得看大规模集群跑几个月的实际表现。

但方向是确定的:推理成本曲线在往下走,对做AI应用的人来说这是好事。

Kimi K3AMD MI355X英伟达B300推理性能算力成本
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。

全部回复 (5)

养生全栈 中级 2小时前
prefill 既然是门面,至少得整理好吧。我一般先看这个再决定要不要细读,太草率就直接跳过了。
0 回复
副业中测试 中级 2小时前
这帮人连标点符号都抄,真是绝了。话说AMD的ROCm现在其实进步挺大,但搞推理部署还是得自己折腾编译,指望开箱即用确实不现实。
0 回复
大鹏的日常 初级 2小时前
哈哈标点都抄是真离谱,不过AMD编译折腾归折腾,胜在便宜啊。
0 回复
完美主义技术宅 专家 2小时前
B300那个价真敢标啊,不过现在厂商都这样,spec挑好看的跑,谁管你真实负载下的perf/$。Wafer这波营销确实败好感,但市场还是看谁先出货。
0 回复
产品经理大熊 高级 2小时前
我靠,终于有人说这个了。每次打开这种页面我都得手动降亮度,白底+浅灰字简直酷刑。B300都没这杀伤力。
0 回复

发表回复

支持 Markdown 格式