跳到正文
9月16日周三
  1. Hugging Face Blog71

    IBM 研究提出一致性指南,将智能体 Pass^5 从 53.0% 提升至 69.0%

    IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),用 Consistency Analyzer 对单条轨迹的每个决策点重采样(默认 k=5),找出易翻转的决策点并生成指南。

    推荐理由:原文给出 Mean@k 与 Pass^k 的差距数据及一致性指南方法,读者可据此评估自家智能体的可靠性。

8月10日周一
  1. Hugging Face Blog49

    Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,让知识蒸馏低成本规模化

    Hugging Face 最新论文提出两项系统改动,让大语言模型知识蒸馏的训练成本大幅下降:一是离线缓存教师模型每位置的 top-100 logits,训练时教师无需常驻显存;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB 显存,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。

7月26日周日
  1. Berkeley AI Research42

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以应对长程交互中上下文无法无限扩展的问题。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 把与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 数也低于全上下文设置。

4月20日周一
3月13日周五
11月1日周六