小米那几颗自研芯片要是真能量产,端侧大模型可能真要变天了

PromptCube 高级 1小时前 498 浏览 11 点赞 约 2 分钟

大家最近看小米发布玄戒 O3、O100 这些自研芯片的规格时,可能觉得也就那样,又是跑分又是带宽。但我前两天在技术沟通会现场摸到了两台工程原型机,那种感觉完全不一样。这不只是纸面数据的堆砌,而是实实在在把大模型塞进本地硬件后的那种“暴力感”。

首先是那台背着主动散热风扇的折叠屏原型机,看着确实有点“硬核”甚至有点笨重。但这台机器配的是玄戒 O100,它最离谱的地方在于内存带宽。在完全断网的情况下,我直接在上面跑 MiMo 3B 模型,输入一段很复杂的提示词,那个响应延迟(TTFT)竟然只有 0.45 秒左右。

  • 生成速度: 实测能达到 303 tokens/s,峰值甚至冲到了 330 tokens/s。
  • 实际体感: 这种速度已经完全快过人眼的阅读节奏了。如果是用来做即时文档润色或者同声传译,那种“秒回”的跟手感,确实比现在那种得等云端吐字的体验要爽得多,最重要的是数据完全不出本地,隐私这块儿确实稳。
小米那几颗自研芯片要是真能量产,端侧大模型可能真要变天了

除了这台折叠屏,现场那个叫 Xiaomi AI Cube 的黑色“方盒子”更像是个生产力工具。它用的是航空铝 CNC 一体成型的,机身开了三万多个散热孔,就为了压住里面跑 120B 参数大模型的发热。

小米那几颗自研芯片要是真能量产,端侧大模型可能真要变天了

这台机器里塞了 80GB 的内存,它最聪明的逻辑是搞了个“快慢双模型切换”的工作流

  • 轻量任务: 用 3B 小模型,响应极其迅速。
  • 重度推理: 比如写代码这种逻辑密集的活,直接交给 120B 大模型去接管。

我当时试着让它写一个带音频波形的钢琴网页应用,它一边解析任务,一边就在右侧刷出大段的前端代码,最后直接在屏幕上跑出了一个可以直接点击发声的 Web Audio 应用。这种在本地就能搞定 Coding 任务的能力,确实让它看起来不像是个玩具,更像是一个桌面端的 AI 算力中枢。

感觉小米现在的思路很清晰:随身设备靠高带宽实现离线即时交互,桌面终端靠大内存和多芯片协同去啃硬骨头。如果这种端侧算力的逻辑能顺利落地到量产机上,以后咱们可能真的不需要为了用个大模型去求着云端服务器了。

小米那几颗自研芯片要是真能量产,端侧大模型可能真要变天了

小米玄戒

全部回复 (3)

大鹏的日常 初级 1小时前
确实,带宽才是关键,不然跑大模型时内存直接爆掉。
0 回复
小柯爱学习 专家 1小时前
这算力分配是怎么做的?要是能把NPU和内存带宽打通,端侧体验确实会起飞。
0 回复
完美主义技术宅 专家 1小时前
上次试过在手机跑本地模型,发热降频得飞快,真要是自研了,功耗管理估计能好很多。
0 回复

发表回复

支持 Markdown 格式