DeepMind 推出 SL2T 模型,将手语翻译接入 Gboard 与 Live Transcribe
DeepMind 发布了大规模多语手语到文字模型 SL2T,并将其用于 Gboard 和 Pixel 11 的 Live Transcribe,首批支持从美式手语(ASL)到英语的手语到文字输入。SL2T 在超过50种手语、约10万小时数据上训练,约四分之一为 ASL,模型以人体关键点(pose landmarks)作为输入并直接翻译为文本以保护隐私。对开发者和使用者而言,这意味着可在手机上用手语完成搜索、起草文本或与 Gemini 交互,更多设备和语言将陆续跟进。
DeepMind 的团队今天介绍了他们称为 SL2T(sign-language-to-text)的手语翻译模型,并将其首次投入消费产品。SL2T 为 Gboard 的手语转文本听写和 Pixel 11 上的 Live Transcribe 提供支持,起始语言为美式手语(ASL)到英语。DeepMind 描述了用户可以在需要打字的任何场景改用手语,比如搜索、起草消息或让 Gemini 处理任务;在对话中也可在 Live Transcribe 内以手语回复。
SL2T 在技术上采用大规模、多语训练:团队在超过50种手语上使用了约100,000小时的数据,其中约四分之一为 ASL。模型接受的是由设备端 MediaPipe Holistic 跟踪得到的姿态坐标点序列(pose landmarks),仅传送这些几何坐标到服务器以保护隐私,原始视频可立即丢弃。模型直接将这些坐标序列翻译为文本,并不依赖传统的中间注释“glosses”。
DeepMind 指出,手语翻译与语音转写不同,既需要完整的机器翻译能力,也要求对手、臂、躯干、头部与面部的同时运动进行高帧率视觉理解。团队在实验中称 SL2T 在关键基准(例如 FLEURS-ASL sd-test)上表现最佳,ASL→英语在零样本下取得 70 BLEURT 的评分。此外,团队在工程实现上关注降低流式延迟、避免对非手语输入产生幻觉、照顾左撇子手语者以及改善单手持机时的表现。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。