开源工具 BootLoops 让 Claude 完成精确科学计算,三个月产出 36 篇手稿
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),在让语言模型反复改写智能体 harness 的同时,通过逐步收紧的编辑预算和严格 critic 过滤硬编码任务名或基准技巧的改动,避免智能体记住测试任务。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为月球科学领域最早的开源基础模型之一。
Aleph Alpha 开发基准测试,用 967 个敏感议题测试阿里千问(Qwen)、DeepSeek 和月之暗面(Kimi)的模型,其自有评分系统仅将 17% 至 41% 的回答评为平衡,其余重复官方立场、回避或拒答。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分,Agent Arena 以 $0.56 中位成本进入第 5。
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
Airbnb CTO Ahmad Al-Dahle 讲述公司转向 AI 原生的内部实践:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,被视为高效推理扩展的下一个范式。现有并行推理方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!