← 返回今日精选
重磅模型发布92

Google DeepMind 发布手语转文本模型 SL2T,首次进入消费级产品

Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,并将其率先应用于 Pixel 11 的 Gboard 和 Live Transcribe。该模型基于超 10 万小时数据训练,支持美国手语到英语的实时转换,让听障用户能直接通过手势进行输入和对话。

Google DeepMind 手语团队发布了全新的手语转文本(SL2T)翻译模型,标志着手语 AI 正式从实验室走向消费级产品。该模型目前已驱动 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本功能,首批支持美国手语(ASL)到英语的翻译。

与语音听写类似,该功能允许听障用户在需要打字的场景下直接向手机打手势,用于搜索网页、起草消息或向 Gemini 提问。在 Live Transcribe 应用中,用户也可以在对话时用手势进行回复,而无需反复打字。测试人员反馈,使用 ASL 手势比打字更快、更自然。

SL2T 模型的训练数据超过 10 万小时,涵盖 50 多种手语。通过联合训练多种语言、方言和熟练程度,模型学习到了共享的底层结构,在实验中表现优于单一语言模型。在 FLEURS-ASL 基准测试中,SL2T 取得了 70 BLEURT 的零样本得分,显著高于此前所有报告的分数。

为了保护用户隐私,SL2T 并不直接处理原始摄像头画面,而是通过设备端的 MediaPipe Holistic 模型将手语输入追踪为身体姿态关键点坐标。只有这些几何坐标会被发送到服务器进行翻译,原始视频会被立即丢弃。

在技术实现上,SL2T 直接将坐标序列翻译为文本,跳过了以往研究中常用的中间注释。这种直接从关键点翻译的方式消除了人工词汇限制,使翻译质量能够随数据量直接提升。此外,团队还优化了流式延迟、防止非手势输入的幻觉以及改善左撇子用户的公平性等实际问题。

Google DeepMind 表示,更多设备即将支持该功能,后续也将增加对其他手语的支持。此举旨在弥合听障与健听人群之间的沟通鸿沟,让听障人士能像健听人士受益于语音处理技术一样,享受手语处理技术带来的便利。

编辑部解读

为什么值得关注

手语 AI 从学术研究迈向消费级应用的关键一步,不仅填补了听障群体在智能输入领域的空白,也为多模态交互开辟了新方向。