笔记本跑千亿参数模型这事终于不再是 PPT 演示了
之前大家聊 AI PC,要么是在吹那些能实时翻译、降噪的“功能性 AI”,要么就是得看 Mac Studio 这种桌面级怪兽。但这次联想直接把英伟达的 RTX Spark 芯片塞进了 16.7 毫米的机身里。最核心的突破在于 NVLink-C2C 互联,它把 20 核 Grace CPU 和 6144 个 CUDA 核心的 Blackwell GPU 揉在了一起,FP4 精度下能提供 1 PFLOPS 的算力。
说白了,这就是在 Windows 阵营里搞了一套类似 Apple Silicon 的“统一内存”架构。以前跑大模型最头疼的就是显存,独显就算再强,24GB 显存面对千亿模型也得跪。现在 CPU 和 GPU 共享同一个 128GB 的物理内存池,数据不用在两者之间来回搬运,模型权重只要存一份,这才是本地跑大模型的关键。
对比一下苹果那边,M5 Max 的 MacBook Pro 顶配 128GB 内存跑 120B 参数的量化模型(4-bit)能到 79 token/s,但长上下文会迅速吃掉内存。而联想这次走的是 CUDA 生态,对于开发者来说,这意味着你不需要在 MLX 这种新框架里摸索,直接用最成熟的 CUDA 技术栈就能在笔记本上部署本地 Agent。

而且这次联想显然是在给“个人 Agent 主机”铺路。除了笔记本,他们还出了个 ThinkCentre X Ultra 这种 1.6 升的小盒子,搭载 AMD 锐龙 AI Max+ PRO 495 系列,同样支持 128GB 统一内存。最激进的是这玩意儿支持 4 台集群互联,直接把办公桌变成了个小型 AI 算力节点。
其实端侧 AI 的竞争点已经变了,现在不是比谁的 TFLOPS 高,而是比谁能让模型“装得下”且“搬得动”。苹果用统一内存+Thunderbolt 集群抢了先机,而 Windows 阵营通过 RTX Spark 终于把本地上下文推到了 100 万 token 这个量级。
对于真正搞 AI 的人来说,这种硬件升级的意义在于:你的项目文档、私有代码和复杂工作流可以彻底留在本地,不用再担心数据上传云端,也不用忍受网络延迟。当一个 Windows 笔记本能稳稳承载千亿模型时,它才真正具备了成为 Agent 宿主的资格。

顺便提几个细节,Yoga Pro 9n 这次用 X Power 散热把 80W TDP 压在了超薄机身里,屏幕是 2.5K 165Hz OLED。另外联想还搞了两个概念机,Project Aeroblade 用了 AirJet 固态散热,机身不到 10mm 且没有风扇;Project Swan 则是 14 到 17 英寸可展开的卷轴屏。
总结来看,这次更新最核心的逻辑就是:统一内存 → 承载千亿模型 → 支撑本地 Agent。Windows 终于在本地大模型这块地盘上,有了能和 Mac 硬刚的硬件底气。
