Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11
Google DeepMind 发布多语种手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 和 Live Transcribe 中上线手语听写功能,首批支持美国手语(ASL)转英文。
推荐理由:SL2T 把多语种手语翻译从实验室带入 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
33 条精选近 30 天 12 条共收录 51 条
Google DeepMind 发布多语种手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 和 Live Transcribe 中上线手语听写功能,首批支持美国手语(ASL)转英文。
推荐理由:SL2T 把多语种手语翻译从实验室带入 Gboard 与 Live Transcribe,读者可了解其数据规模与隐私设计。
Google Research 发布基于 Gemini 和 Project Astra 的 AMIE (Video),可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步进行诊断推理。
推荐理由:原文给出 AMIE (Video) 的三智能体架构与随机 OSCE 研究设计,读者可据此了解实时视频临床 AI 的能力边界与验证方式。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和 NIM 部署路径,可据此评估自建语音链路的延迟与定制空间。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体的可用性。
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出视频理解、任务编排与多机协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称新版本在音乐性、歌词、人声和创作控制四方面改进:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,同时可更便捷地控制输出 tempo 与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次实现对完整人形机器人的全身控制,并提升灵巧操作与多机器人协作能力。
推荐理由:原文给出三个模型的职责分工与端侧适配数据,读者可据此判断机器人智能层的落地路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款新模型同时开放开发者与消费端入口,并给出延迟、价格与能力边界,便于判断多模态工作流成本。
Google DeepMind 发布 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:原文给出模型能力、延迟表现与开发者接入路径,读者可据此判断实时语音翻译的落地方式。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。
Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色。
推荐理由:Google 公开了迄今规模最大的手机摄像头 rPPG 研究,读者可了解被动心率监测如何做到全肤色准确。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 锚定能力,可基于美国真实地点影像生成可交互世界,并支持选择 Desert Sands、Stone Age、Ocean World、B&W film 等风格。
推荐理由:原文说明 Genie 如何用 Street View 真实影像为生成世界提供地理锚点,读者可了解世界模型落地路径。