在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
LocaXion 在一家一级汽车供应商工厂部署基于位置智能的 ANDON 方案,将机器缺料相关停机平均每周减少 17 小时。该方案在现有叉车与牵引车 RTLS 数据之上叠加定量与定时 ANDON 层,结合路线标准、时间窗口、暂存区与异常规则,让驾驶员和主管实时看到路线是否偏离标准。工厂经理 Patrice Brooks 表示,方案提供了可每日管理的厂内物流基线,并可用于仿真预演路线与人员调整。