跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

33 条精选近 30 天 12 条共收录 51 条

更新

精选归档 · 第 2 页

8月12日周三第 21–33 条
  1. Google Research78

    Google Research 发布 AMIE (Video),实时视频问诊达到专家级水平

    Google Research 发布基于 Gemini 和 Project Astra 的 AMIE (Video),可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步进行诊断推理。

    推荐理由:原文给出 AMIE (Video) 的三智能体架构与随机 OSCE 研究设计,读者可据此了解实时视频临床 AI 的能力边界与验证方式。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言开源权重模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和 NIM 部署路径,可据此评估自建语音链路的延迟与定制空间。

8月10日周一
7月30日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。

    推荐理由:官方给出视频理解、任务编排与多机协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

  2. Google DeepMind62

    Google DeepMind 在 Google Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称新版本在音乐性、歌词、人声和创作控制四方面改进:旋律结构更丰富自然,歌词质量与提示词遵循、结构感知更好,人声更具表现力和情感且发音改善,同时可更便捷地控制输出 tempo 与时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。

7月28日周二
7月21日周二
7月1日周三
6月9日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。

6月5日周五
  1. Google Research76

    Google 研究用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图对比的平均绝对百分比误差低于 10%,覆盖所有肤色。

    推荐理由:Google 公开了迄今规模最大的手机摄像头 rPPG 研究,读者可了解被动心率监测如何做到全肤色准确。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 锚定能力,可基于美国真实地点影像生成可交互世界,并支持选择 Desert Sands、Stone Age、Ocean World、B&W film 等风格。

    推荐理由:原文说明 Genie 如何用 Street View 真实影像为生成世界提供地理锚点,读者可了解世界模型落地路径。