听人早已把「对着手机说话」当成默认输入,手语用户却长期停在实验室演示——Google DeepMind试图把这件事写进出厂功能。
Google DeepMind是谷歌的前沿AI研究与产品化单元,长期覆盖语言模型、多模态与科学应用。手语AI难在两点:其一,手语是独立自然语言,不是「把手势逐个映射成英语单词」;其二,意义同时由手、臂、躯干、头与面部运动承载,对计算机视觉与翻译都苛刻。早期手套方案之所以先天不足,正是因为把手语简化成了「手上的英语」。
8月12日,团队介绍大规模多语种手语到文本模型SL2T(sign-language-to-text),并宣布其驱动Pixel 11上Gboard与Live Transcribe中的手语转文字听写:用户可在本该打字的场景用手语搜索、起草消息与文档,或向Gemini发起任务;在Live Transcribe中可用手语回应对话。首发支持美国手语(ASL)到英语,更多设备与更多手语将随后跟进,且不额外收费。
官方披露的机制与指标口径:
把SL2T放进无障碍与消费硬件坐标:里程碑不在于又一篇论文,而在于首次进入可出货手机功能。对听障用户,价值是输入速度与自然度;对谷歌,则是把「人人可用」写进操作系统级入口。官方示例也承认罕见手势、快速指拼、被动句与分类器描绘等仍可能出错——首发仅ASL,不等于全球手语无障碍已完成。
下一观察点是更多手语上线节奏,以及真实通勤、嘈杂背景与多签名者场景中的误译率与用户留存——实验室分数是门票,日常对话才是验收。