Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体如何用世界状态记忆抑制跨镜头漂移。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
2 条精选近 30 天 2 条共收录 3 条
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体如何用世界状态记忆抑制跨镜头漂移。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:官方给出实时视频化身与异步工具调用的组合方式,读者可据此判断企业对话智能体的交互形态变化。