Gemini的算力焦虑:谷歌在搞超低功耗芯片

PromptCube 中级 1天前 更新于 2026年7月25日 317 浏览 11 点赞 约 2 分钟

把大模型塞进端侧设备,最大的敌人不是模型参数量,而是功耗和发热。谷歌现在传出在研发一款专门给Gemini优化的超高效AI芯片,这逻辑很明显:既然不能无限增加电量,那就从底层硬件上把每瓦性能(Performance per Watt)榨干。

现在的端侧AI运行逻辑很尴尬,要么依赖NPU但调度极烂,要么直接跑在GPU上导致手机烫得能煎蛋。如果这款芯片能实现在保持量化精度(比如INT8甚至FP8)的同时,把功耗降低一个数量级,那Gemini Nano在手机上的常驻能力就完全不同了。

从技术路径推测,谷歌大概率在尝试两种方向:一是极致的近内存计算(Near-Memory Computing),减少数据在内存和处理器之间搬运的能耗;二是针对Transformer架构的硬件级指令集优化,直接在电路层面实现更高效的Attention计算。

我之前实测过在部分安卓旗舰上跑本地模型,即便模型只有几B参数,在连续对话5分钟后,CPU频率会因为过热直接掉到1.2GHz左右,响应延迟从原来的0.8秒直接飙升到3秒以上。如果新芯片能把能效比提升,解决掉这个掉频问题,端侧Agent才真正有实操意义。

对于开发者来说,最关键的其实是底层指令集是否开放。如果谷歌像以前一样把硬件能力锁死在自己的闭源框架里,那第三方优化就很难做。理想状态应该是能通过类似以下这种底层的量化配置直接调用硬件加速:

{
  "runtime_config": {
    "precision": "int8_quantized",
    "acceleration_unit": "google_ultra_eff_chip_v1",
    "power_mode": "sustained_performance",
    "memory_allocation": "static_pinned"
  }
}

这种硬件级的优化如果能落地,未来的AI Agent工作流就不再是“请求云端 -> 等待响应 -> 执行”,而是直接在本地完成 90% 的预处理和逻辑判断,只有最复杂的推理才交给Gemini Pro。

这种端云结合的部署模式,核心就看这款芯片的实测能效比能不能支撑起长时间的后台运行。如果能把待机功耗压到毫安级别,手机端真正意义上的“实时AI助手”才算把硬件基建给补齐了。

行业动态AI新闻

全部回复 (3)

养生全栈 中级 10小时前
如果真能把功耗压下来,那端侧运行的时候量化损失会大吗?
0 回复
完美主义技术宅 专家 10小时前
@养生全栈 这得看压缩算法怎么搞,不过端侧要是能跑顺,谁还天天盯着云端啊?
0 回复
副业中测试 中级 10小时前
我之前试过端侧模型,只要稍微多聊两句,手机壳都能烫手,真得在硬件上下功夫。
0 回复

发表回复

支持 Markdown 格式