Google DeepMind|SL2T手语转文字上线Pixel 11

PromptTree|阅读 1
2026/08/13 08:16
Google DeepMindSL2TPixel 11ASL无障碍
8月12日,Google DeepMind发布手语到文本模型SL2T,驱动Pixel 11上Gboard与Live Transcribe的ASL到手写英语听写;训练数据跨逾50种手语、逾10万小时,端侧仅上传姿态坐标以保护隐私。

听人早已把「对着手机说话」当成默认输入,手语用户却长期停在实验室演示——Google DeepMind试图把这件事写进出厂功能。

Google DeepMind是谷歌的前沿AI研究与产品化单元,长期覆盖语言模型、多模态与科学应用。手语AI难在两点:其一,手语是独立自然语言,不是「把手势逐个映射成英语单词」;其二,意义同时由手、臂、躯干、头与面部运动承载,对计算机视觉与翻译都苛刻。早期手套方案之所以先天不足,正是因为把手语简化成了「手上的英语」。

8月12日,团队介绍大规模多语种手语到文本模型SL2T(sign-language-to-text),并宣布其驱动Pixel 11上Gboard与Live Transcribe中的手语转文字听写:用户可在本该打字的场景用手语搜索、起草消息与文档,或向Gemini发起任务;在Live Transcribe中可用手语回应对话。首发支持美国手语(ASL)到英语,更多设备与更多手语将随后跟进,且不额外收费。

官方披露的机制与指标口径:

  1. 数据:逾10万小时、跨越50余种手语联合训练,其中约四分之一为ASL,以学习共享结构。
  2. 隐私:端侧MediaPipe Holistic提取姿态关键点,仅将几何坐标送服翻译,原始视频可立即丢弃。
  3. 路径:从坐标序列直接译入文本,绕开难以表达非手控标记与空间结构的中间「gloss」标注。
  4. 评测:在FLEURS-ASL等基准上给出约70 BLEURT零样本分数口径,并强调流式低延迟、非手语画面幻觉抑制、左手与单手持机签名可用性。
  5. 治理:成立AI手语咨询委员会,与听障社群共同发布影响报告,透明说明能力与局限。

把SL2T放进无障碍与消费硬件坐标:里程碑不在于又一篇论文,而在于首次进入可出货手机功能。对听障用户,价值是输入速度与自然度;对谷歌,则是把「人人可用」写进操作系统级入口。官方示例也承认罕见手势、快速指拼、被动句与分类器描绘等仍可能出错——首发仅ASL,不等于全球手语无障碍已完成。

下一观察点是更多手语上线节奏,以及真实通勤、嘈杂背景与多签名者场景中的误译率与用户留存——实验室分数是门票,日常对话才是验收。