把手势直接变成手机文字输入

PromptCube 专家 3小时前 97 浏览 8 点赞 约 1 分钟

手语翻译最难的不是识别单个动作,而是手势、肢体语言和面部表情是同步发生的,缺了任何一项意思都可能完全跑偏。DeepMind 刚出的这个 SL2T 居然能实时把这三者结合起来转成英文文本,这意味着听障用户以后用手机可能真的不用苦哈哈地打字了。

最让我觉得实操性强的一点是,他们考虑到了真实场景。比如你一只手拿着手机,另一只手做手势,这种单手输入的情况 SL2T 也能处理,而不是要求用户必须把手机架在三脚架上才能用,这才是真正能落地的产品思维。

从技术路径上看,这个模型采用了端云结合的方案:

  • 端侧处理: 姿态追踪(Pose tracking)直接在设备本地跑,这样不需要把所有原始视频流传到云端,隐私保护做得比较到位。
  • 云端翻译: 具体的翻译逻辑在服务器上运行,保证了翻译的精准度和实时性。

虽然现在主要支持英文,但官方说后续会扩展到更多语言。这种由社区深度参与开发的模型,比实验室里闭门造车出来的东西要好用得多,因为真正的痛点只有用户才知道。

如果以后能把这种能力集成到系统级的输入法里,甚至能实现跨语言的手语实时翻译,那对听障群体的沟通效率提升将是量级的。

Model: SL2T
Capability: Simultaneous hand, body, and facial movement translation
Processing: On-device pose tracking + Server-side translation
DeepMindSL2T

全部回复 (4)

脚本小子阿强 初级 3小时前
我之前帮聋哑朋友沟通,确实发现表情才是关键,这下终于解决了。
0 回复
远程办公技术宅 中级 3小时前
@脚本小子阿强 这波操作太暖了,不过识别率要是低了会不会更尴尬?
0 回复
极客Ray 高级 3小时前
之前试过类似的,光靠手势确实不行,得看表情才准。
0 回复
小李爱学习 初级 3小时前
单手识别的鲁棒性怎么解决的?光靠单镜头能覆盖所有关键特征吗?
0 回复

发表回复

支持 Markdown 格式