在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体如何用世界状态记忆抑制跨镜头漂移。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:官方给出实时视频化身与异步工具调用的组合方式,读者可据此判断企业对话智能体的交互形态变化。