Google DeepMind 发布手语转文本模型 SL2T,首次登陆 Pixel 11 消费级产品
Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,并将其首次带入消费级产品。该模型现已驱动 Pixel 11 上的 Gboard 键盘和实时转录功能,支持美国手语到英语的转换,让听障用户能直接用手语代替打字。
Google DeepMind 手语团队正式发布了大规模多语言手语转文本(SL2T)翻译模型。官方表示,这是手语 AI 首次从实验室走向消费级产品。目前,该模型已开始为 Pixel 11 设备上的 Gboard 和 Live Transcribe 提供手语转文本听写功能,首发支持美国手语(ASL)翻译为英语,未来将支持更多设备和语言。
借助该功能,听障用户可以在任何通常需要打字的场景下直接对着手机打手语,例如进行网页搜索、起草消息或文档,或者向 Gemini 提问并执行任务。在 Live Transcribe 应用中,用户也可以在对话时直接用手语进行回复,而无需反复输入文字。测试人员反馈,使用 ASL 打手语比输入英语更快、更自然。
手语翻译相比语音转录面临两大核心挑战。首先,手语是与口语完全独立的自然语言,拥有独特的语法和词汇,因此需要真正的机器翻译而非简单的逐词转换。其次,模型必须学会“看”并理解物理动作,因为手语通过手、臂、躯干、头部和面部的协同运动来传达含义,以高帧率精准追踪这些动作是一项计算量极大的计算机视觉任务。
为了应对这些挑战,SL2T 在超过 10 万小时、涵盖 50 多种手语的数据上进行了训练,其中约四分之一为 ASL 数据。多语言、方言和不同熟练程度的联合训练,使模型能够学习到共享的底层结构,在实验中表现优于单一语言模型。在 FLEURS-ASL 基准测试中,SL2T 取得了 70 BLEURT 的零样本得分,显著高于此前所有公布的分数。
在隐私保护方面,SL2T 并不直接读取原始摄像头画面,而是利用设备端的 MediaPipe Holistic 模型将手语输入追踪为身体关键点的几何坐标序列。只有这些坐标会被发送至服务器进行翻译,原始视频会被立即丢弃。此外,该模型直接从坐标点序列翻译为文本,跳过了以往常用的中间注释,从而消除了人工词汇限制,使翻译质量能随数据量直接提升。
除了追求学术基准表现,团队还针对实际应用中的问题进行了优化,包括最小化流式传输延迟、防止对非手语输入产生幻觉、确保占 signer 总数 10% 的左撇子用户的使用公平性,以及提升整体性能。
为什么值得关注
SL2T 的发布标志着手语 AI 正式迈入实用化阶段,为听障群体提供了全新的无障碍交互方式,有望重塑数千万用户的数字沟通体验。