把手势直接变成手机文字输入
手语翻译最难的不是识别单个动作,而是手势、肢体语言和面部表情是同步发生的,缺了任何一项意思都可能完全跑偏。DeepMind 刚出的这个 SL2T 居然能实时把这三者结合起来转成英文文本,这意味着听障用户以后用手机可能真的不用苦哈哈地打字了。
虽然现在主要支持英文,但官方说后续会扩展到更多语言。这种由社区深度参与开发的模型,比实验室里闭门造车出来的东西要好用得多,因为真正的痛点只有用户才知道。
最让我觉得实操性强的一点是,他们考虑到了真实场景。比如你一只手拿着手机,另一只手做手势,这种单手输入的情况 SL2T 也能处理,而不是要求用户必须把手机架在三脚架上才能用,这才是真正能落地的产品思维。
从技术路径上看,这个模型采用了端云结合的方案:
- 端侧处理: 姿态追踪(Pose tracking)直接在设备本地跑,这样不需要把所有原始视频流传到云端,隐私保护做得比较到位。
- 云端翻译: 具体的翻译逻辑在服务器上运行,保证了翻译的精准度和实时性。
虽然现在主要支持英文,但官方说后续会扩展到更多语言。这种由社区深度参与开发的模型,比实验室里闭门造车出来的东西要好用得多,因为真正的痛点只有用户才知道。
如果以后能把这种能力集成到系统级的输入法里,甚至能实现跨语言的手语实时翻译,那对听障群体的沟通效率提升将是量级的。
Model: SL2T
Capability: Simultaneous hand, body, and facial movement translation
Processing: On-device pose tracking + Server-side translation 事件追踪 · 相关报道
用大模型解决一个被人类搁置了 25 年的数学难题真的太离谱了
4天前
DeepMind 这个 WeatherNext 预测气旋的精度居然能
4天前
Demis Hassabis 都要退出 DeepMind 日常管理了
5天前
Google的人才流失危机:规模扩张与核心开发者离职的悖论
6天前
Google把DeepMind的掌门人挪到更大的盘子里面去
7天前
Jeff Dean离开Google:一篇AI架构重组的序章
7天前