IBM 研究提出一致性指南,将智能体 Pass^5 从 53.0% 提升至 69.0%
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),用 Consistency Analyzer 对单条轨迹的每个决策点重采样(默认 k=5),找出易翻转的决策点并生成指南。
推荐理由:原文给出 Mean@k 与 Pass^k 的差距数据及一致性指南方法,读者可据此评估自家智能体的可靠性。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),用 Consistency Analyzer 对单条轨迹的每个决策点重采样(默认 k=5),找出易翻转的决策点并生成指南。
推荐理由:原文给出 Mean@k 与 Pass^k 的差距数据及一致性指南方法,读者可据此评估自家智能体的可靠性。
Hugging Face 最新论文提出两项系统改动,让大语言模型知识蒸馏的训练成本大幅下降:一是离线缓存教师模型每位置的 top-100 logits,训练时教师无需常驻显存;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB 显存,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以应对长程交互中上下文无法无限扩展的问题。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 把与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 数也低于全上下文设置。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型脆弱的“状态输入”梯度。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。
Berkeley AI Research 提出一种基于分治范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。