端侧 AI 的死穴在功耗:谷歌研发超低功耗芯片能否救 Gemini Nano?
我之前在几款安卓旗舰机上实测过本地小模型,即便模型规模只有几 B 参数,在进行连续对话 5 分钟后,CPU 频率会因为过热直接掉到 1.2GHz 左右。这时候响应延迟会从最初的 0.8 秒直接飙升到 3 秒以上。这种由于掉频导致的卡顿,让端侧 Agent 失去了实时交互的实操意义。
在这种背景下,谷歌研发专门为 Gemini 优化的超高效 AI 芯片就显得逻辑清晰:既然电池电量无法无限增加,就必须从底层硬件上榨干每瓦性能(Performance per Watt)。如果这款芯片能在保持量化精度(如 INT8 甚至 FP8)的同时,将功耗降低一个数量级,Gemini Nano 在手机上的常驻能力将产生质变。
从技术路径来看,谷歌大概率在尝试两个方向。首先是极致的近内存计算(Near-Memory Computing),其核心目的就是减少数据在内存和处理器之间频繁搬运所产生的能耗,因为在端侧设备中,数据传输的能耗往往高于计算本身。其次是针对 Transformer 架构的硬件级指令集优化,尝试在电路层面直接实现更高效的 Attention 计算,而不是通过通用指令集去模拟。
对于开发者而言,最关键的其实是底层指令集是否开放。如果谷歌将硬件能力锁死在闭源框架里,第三方优化将极其困难。理想的状态应该是允许开发者通过底层的量化配置直接调用硬件加速,例如在运行时通过如下配置来锁定硬件性能:
{
"runtime_config": {
"precision": "int8_quantized",
"acceleration_unit": "google_ultra_eff_chip_v1",
"power_mode": "sustained_performance",
"memory_allocation": "static_pinned"
}
}如果这种硬件级的优化能够落地,未来的 AI Agent 工作流将彻底改变。目前的模式是“请求云端 → 等待响应 → 执行”,而端云结合的理想状态应该是:90% 的预处理和逻辑判断直接在本地由低功耗芯片完成,只有最复杂的推理任务才交给云端的 Gemini Pro。
这种部署模式的核心,就看这款新芯片的实测能效比能否支撑起长时间的后台运行。如果能将待机功耗压低到毫安级别,手机端真正意义上的“实时 AI 助手”才算补齐了硬件基建。否则,无论模型量化做得多好,只要发热问题不解决,端侧 AI 永远只是一个偶尔启动的“功能”,而无法成为像操作系统一样常驻的底层能力。