Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型
Google DeepMind 发布 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:原文给出模型能力、延迟表现与开发者接入路径,读者可据此判断实时语音翻译的落地方式。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
42 条精选近 30 天 17 条共收录 60 条
Google DeepMind 发布 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:原文给出模型能力、延迟表现与开发者接入路径,读者可据此判断实时语音翻译的落地方式。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。