新闻

谷歌DeepMind发布SL2T,手语AI首次进入消费级手机 谷歌旗下DeepMind发布全新多语言手语转文本模型SL2T,并将其搭载至Pixel11手机系统,首次推动手语AI进入普通消费电子产品

1 分钟阅读
谷歌DeepMind发布SL2T,手语AI首次进入消费级手机 谷歌旗下DeepMind发布全新多语言手语转文本模型SL2T,并将其搭载至Pixel11手机系统,首次推动手语AI进入普通消费电子产品。该模型率先接入Gboard键盘和Live Transcribe,用户通过前置摄像头完成手语动作,即可进行消息编辑、网页检索及与Gemini对话,替代传统键盘输入。 SL2T基于超过50种手语、累计10万小时手语素材训练,其中约四分之一来自美国手语数据集。跨语种联合训练帮助模型学习不同手语之间的共通动作逻辑,并在FLEURS-ASL评测中刷新手语转写模型纪录。与依赖固定词汇标签的传统方案不同,SL2T可直接解析人体动作生成文本,同时处理面部表情、肢体空间位置和唇部动作等非手部语义信息。 隐私方面,手机端MediaPipe Holistic实时追踪手部、面部和躯干共130处关键点,仅向外传输动作坐标,原始视频会即时删除,不上传云端。目前该功能仅支持美国手语转英文,谷歌计划后续扩展更多手语及安卓机型。 DeepMind此前于2025年5月开源手语互译模型SignGemma,为SL2T落地提供算法基础。此外,其WaveNet、Euphonia及Live Transcribe等无障碍技术也积累了语音、视觉多模态经验。随着谷歌、科大讯飞、华为和苹果持续布局,AI无障碍交互正从科研验证加速走向消费级产品。 via AI新闻资讯 (author: AI Base)