小米那几颗自研芯片要是真能量产,端侧大模型可能真要变天了
大家最近看小米发布玄戒 O3、O100 这些自研芯片的规格时,可能觉得也就那样,又是跑分又是带宽。但我前两天在技术沟通会现场摸到了两台工程原型机,那种感觉完全不一样。这不只是纸面数据的堆砌,而是实实在在把大模型塞进本地硬件后的那种“暴力感”。
除了这台折叠屏,现场那个叫 Xiaomi AI Cube 的黑色“方盒子”更像是个生产力工具。它用的是航空铝 CNC 一体成型的,机身开了三万多个散热孔,就为了压住里面跑 120B 参数大模型的发热。
我当时试着让它写一个带音频波形的钢琴网页应用,它一边解析任务,一边就在右侧刷出大段的前端代码,最后直接在屏幕上跑出了一个可以直接点击发声的 Web Audio 应用。这种在本地就能搞定 Coding 任务的能力,确实让它看起来不像是个玩具,更像是一个桌面端的 AI 算力中枢。
首先是那台背着主动散热风扇的折叠屏原型机,看着确实有点“硬核”甚至有点笨重。但这台机器配的是玄戒 O100,它最离谱的地方在于内存带宽。在完全断网的情况下,我直接在上面跑 MiMo 3B 模型,输入一段很复杂的提示词,那个响应延迟(TTFT)竟然只有 0.45 秒左右。
- 生成速度: 实测能达到 303 tokens/s,峰值甚至冲到了 330 tokens/s。
- 实际体感: 这种速度已经完全快过人眼的阅读节奏了。如果是用来做即时文档润色或者同声传译,那种“秒回”的跟手感,确实比现在那种得等云端吐字的体验要爽得多,最重要的是数据完全不出本地,隐私这块儿确实稳。
除了这台折叠屏,现场那个叫 Xiaomi AI Cube 的黑色“方盒子”更像是个生产力工具。它用的是航空铝 CNC 一体成型的,机身开了三万多个散热孔,就为了压住里面跑 120B 参数大模型的发热。

这台机器里塞了 80GB 的内存,它最聪明的逻辑是搞了个“快慢双模型切换”的工作流:
- 轻量任务: 用 3B 小模型,响应极其迅速。
- 重度推理: 比如写代码这种逻辑密集的活,直接交给 120B 大模型去接管。
我当时试着让它写一个带音频波形的钢琴网页应用,它一边解析任务,一边就在右侧刷出大段的前端代码,最后直接在屏幕上跑出了一个可以直接点击发声的 Web Audio 应用。这种在本地就能搞定 Coding 任务的能力,确实让它看起来不像是个玩具,更像是一个桌面端的 AI 算力中枢。
感觉小米现在的思路很清晰:随身设备靠高带宽实现离线即时交互,桌面终端靠大内存和多芯片协同去啃硬骨头。如果这种端侧算力的逻辑能顺利落地到量产机上,以后咱们可能真的不需要为了用个大模型去求着云端服务器了。

事件追踪 · 相关报道
苹果这次在系统视频里不小心剧透了带摄像头的 AirPods
6天前
免费 AI 工具箱 · 全部完全免费
