过去,听人可以对着手机说话来打字,手语用户却往往仍要切回键盘。Google DeepMind 发布手语转文字模型 SL2T——它读取手形、动作、面部表情和身体姿态,再把连续手语翻译成文字。手语有自己的语法,并非把英语逐字“打”出来,因此这既是视觉识别,也是机器翻译。
Google 称,SL2T 已开始为 Pixel 11 上的 Gboard 和 Live Transcribe 提供美国手语(ASL)到英语的输入:用户可以用手语搜索、写消息、向 Gemini 提问,也能在对话转写中直接用手语回应。模型使用超过 10 万小时、覆盖 50 多种手语的数据联合训练,其中约四分之一为 ASL;摄像头画面会先由设备端模型转换为人体姿态关键点,SL2T 接收的是这些位置序列,而非原始视频。
值得注意的不是又一次实验室演示,而是手语开始成为消费产品里的日常输入方式。Google 表示还会支持更多设备和语言,但材料未披露具体时间,也没有给出独立评测结果。