摘要:Google DeepMind推出SL2T手语转文本模型,首发搭载于Pixel 11,支持美国手语实时转英文。本文解析技术架构、隐私设计、性能数据与行业意义。
8月12日,Google DeepMind发了一篇博客。
标题叫《把手语AI交到用户手中》。不是概念演示,不是实验室成果。SL2T(sign-language-to-text)模型直接塞进了Pixel 11的Gboard和Live Transcribe里。手语AI第一次进入消费级产品。
全球约7000万聋人和听障人士,使用超过200种手语。在此之前,语音AI能听懂几十种语言、能做实时翻译、能对话,但这7000万人被整个AI行业忽视了。SL2T要填的就是这个空白。
它不是“把动作翻译成单词”
手语不是英语的手势版。
DeepMind在博客里专门强调了一点:手语是独立的自然语言,有自己的语法和词汇。把手语翻译成文本,本质上是机器翻译问题,不是“把动作序列映射成文字”那么简单。
更麻烦的是,手语靠的是双手、手臂、躯干、头部、面部的同时运动。一个词的意思可能取决于你眉毛挑了一下还是头歪了方向。模型得“看见”并理解这些物理运动,每秒处理几十帧。
SL2T是冲着这两个难题去的。
10万小时,50种手语
训练数据:超过10万小时的手语视频,覆盖50多种手语,其中约四分之一是美国手语。
跨语言训练是这模型的一个关键选择。虽然首发只支持ASL转英文,但用50种手语一起训练,模型能学到不同手语之间共有的结构规律,效果反而比单语言模型好。
性能数据上,SL2T在FLEURS-ASL基准测试中取得70 BLEURT的零样本得分。官方称这个分数“显著高于此前任何公开结果”。单手手语变体74 BLEURT,PRESTO-ASL数据集上85 BLEURT。FSboard指语数据集上精确匹配准确率64%。
当然,这些是供应商报告的数字,还没有独立的第三方评估。
但有个细节值得注意:模型偶尔会替换罕见手语和快速指语,在上下文缺失时会丢失时态。一个例子是把“This fully feathered, warm blooded bird of prey”翻译成“This creature is warm-blooded, eats grey”——“prey”被指语识别成了“grey”。另外还有残留的幻觉行为,没人打手语时也会生成文本。谷歌说发布版本比7月测试的预发布版本显著改善了这些问题,但并未完全消除。
不上传视频,只传坐标
隐私是这套系统的另一个设计重点。
SL2T用的是一个叫MediaPipe Holistic的端侧计算机视觉模型。它在设备本地追踪手语者的面部、双手、手臂和躯干的几何姿态坐标。原始摄像头输入立即被丢弃,只有坐标数据被发送到云端服务器做翻译。
全程不上传任何实际视频。
这意味着什么?你的手语视频不会离开你的手机。传出去的只是一串数字坐标——脸在什么位置、手在什么角度、身体怎么摆的。Google自己都看不到你打手语的样子。
模型还跳过了以往手语翻译系统依赖的“中间注释层”。以前的系统得先把每个手语动作标成一个固定标签再翻译,标签一固定就丢了非手部表情和空间语法结构。SL2T直接把手语序列转成文本,绕开了这个瓶颈。
其他优化包括:延迟优化、非手语动作的幻觉预防机制、支持左利手和单手手语输入。
能用它干什么
对听障用户来说,SL2T改变的是日常交互方式。
以前打字的地方,现在可以直接对着手机摄像头打手语。搜索网页、写邮件和短信、编辑文档,全部用手语完成。还能用手语向Gemini发指令。在Live Transcribe里,面对面交谈时直接用手语回应,不用来回打字。
测试者的反馈是:用ASL打手语比用英语打字更快、更自然、更令人愉悦。
首批搭载Pixel 11,8月20日发售。更多设备后续会跟上,更多手语也会逐步支持,全部免费。
不只是技术问题
DeepMind这次还做了一件事:联合多个聋人组织及手语专家成立了AI手语咨询委员会。委员会共同撰写了一份影响报告,详细说明SL2T的能力和当前局限性。
这在这个行业里不多见。
手语AI的研发长期滞后,除了技术难度大,还有一个原因是广泛存在的误解——很多人以为手语只是“用手比划的英语”。这种误解导致早期技术尝试走了弯路,比如传感器手套。DeepMind在博客里明确说,那种方案“从根本上就是有限的”——因为手语不是“手上的英语”。
SL2T不是第一个手语识别系统,但它是第一个被塞进消费级产品、让普通用户在日常场景里真正用得上的。
一个模型能在基准测试里拿多高的分是一回事。一个听障人士能对着手机打手语完成日常操作,是另一回事。
后者才是衡量这件事的标准。
