DeepMind 那个代号叫 Astra 的多模态模型到底想怎么改变
很多人对多模态的理解还停留在“看图说话”或者“语音对话”这种单点交互上,但 DeepMind 最近披露的 Astra 技术路径显示,他们根本没打算做一个只会聊天的机器人,而是想做一个拥有实时感知能力的“数字大脑”。
这次披露的核心逻辑在于,它试图解决大模型在实时交互中最致命的两个问题:延迟感和感知断层。
实时感知的底层逻辑
传统的视觉语言模型(VLM)处理图片通常是“快照式”的,你传一张图,它分析一下,然后给你一段文本。但 Astra 的目标是实现一种持续的流式输入处理。
- 视觉流实时化: 它不再是等待用户点击上传,而是通过持续的视觉流(Video Stream)来理解环境的变化。这意味着如果你在摄像头前挥挥手,或者把一个杯子移开,模型能像人类一样感知到这种动态过程,而不是在下一帧才反应过来。
- 多模态对齐的深度: 这里的关键不在于模型能看能听,而在于它能把听到的声音和看到的视觉特征在同一个时间轴上精准对齐。比如它能通过声音判断一个物体掉落在地上的材质,并结合视觉画面给出反馈。
安全护栏的博弈
在追求极致实时性的同时,DeepMind 显然也意识到了风险。这种“全时段感知”的能力一旦失控,隐私和安全问题会比纯文本模型严重几个数量级。
他们在报告里提到的 frontier safeguards(前沿防护措施)其实是在构建一套实时拦截机制。这不仅仅是后端的敏感词过滤,更涉及到一种“行为预测型”的安全防御。比如模型在观察用户的实时环境时,如果检测到潜在的危险动作或者侵犯隐私的视觉信息,系统需要能在毫秒级做出决策,直接切断特定模态的推理路径。
这种在“极速响应”和“严苛安全”之间找平衡点的做法,其实是所有端侧 AI Agent 必须要踩的坑。如果模型因为过度的安全过滤而变得反应迟钝,那这种实时交互也就失去了意义。
事件追踪 · 相关报道
Gemini 这种全家桶权限开放得有点过头了
2小时前
大厂们正试图通过医疗这个“避风港”来缓解公众对 AI 的敌意
17小时前
好莱坞这帮大佬们刚把 AI 给告上法庭
1天前
连续扩散语言模型 CDLM
2天前
Google 搞出的这个 WikiSkill 框架有点意思
2天前
Google 现在的搜索体验越来越像是一个封闭的问答机器
3天前
免费 AI 工具箱 · 全部完全免费
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。
全部回复 (6)
强
脚
老
这确实是个深层问题,RLHF 到底能不能彻底洗掉底层的“恶意”逻辑?我比较担心的是模型学会了那种‘表面合规’的策略,也就是所谓的 Sandbox evasion,一旦到了脱离评估环境的真实场景,这种伪装性极强的东西很难防。
0
大
早
这要是真被那些黑产拿去跑自动化攻击,那真不是开玩笑的。我就在想,现在的安全防御手段是不是也得跟着模型一起进化才行?
感觉现在的测评环境还是太“干净”了,真要是放在那种复杂的生产环境里,模型能不能保持这种满分水平还得打个问号,感觉还是有点悬。