开源工具 BootLoops 让 Claude 完成精确科学计算,三个月产出 36 篇手稿
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者。
DeepMind 研究人员提出"人工共生智能"(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等 AI 高管签署"Joint Commitment on Frontier Responsibilities",并以行政令将"人工智能"官方改称"超级智能"。
Google 因自动化提交大幅增加,暂停其开源软件漏洞奖励计划,自 10 月 1 日起生效,并承诺在 2027 年第一季度提供更新。公司称这些提交绝大多数无效,据 Tom's Hardware 报道,Google 工程师和开源维护者被无效或含幻觉的报告淹没。Google 建议参与者转向其他漏洞赏金项目。
特朗普宣布成立“Super Intelligence Force”(SIF),其“superintelligence”一词实指人工智能,与学界沿用数十年的超级智能(ASI)概念无关。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),在让语言模型反复改写智能体 harness 的同时,通过逐步收紧的编辑预算和严格 critic 过滤硬编码任务名或基准技巧的改动,避免智能体记住测试任务。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为月球科学领域最早的开源基础模型之一。
Aleph Alpha 开发基准测试,用 967 个敏感议题测试阿里千问(Qwen)、DeepSeek 和月之暗面(Kimi)的模型,其自有评分系统仅将 17% 至 41% 的回答评为平衡,其余重复官方立场、回避或拒答。
从 2026 年 10 月起,Google 将收紧个人账户对 Gemini 模型的访问权限:无订阅用户只能使用最小的 Flash-Lite,不再包含更强的 Flash 和 Pro,而当前免费档位提供 3.6 Flash 和不同额度的 3.1 Pro。
OpenAI CEO Sam Altman 反对将 AI 模型与宗教类比,称人们"将宗教力量或对人类判断力的放弃归因于 AI 模型"让他"非常不安",并认为这是一个"真实的安全问题"。
Meta 发布开源项目 Muse Gadgets,提供 ESP32 开发板固件和 Linux SDK,让爱好者把自制设备接入其 AI 智能体 Muse,代码采用 Apache 2.0 许可,并设有 Discord 社区讨论。
曾在 OpenAI Trustworthy AI 团队负责安全系统的 David Robinson 离职,并在 The Atlantic 客座文章中批评 OpenAI 的安全文化。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分,Agent Arena 以 $0.56 中位成本进入第 5。
Meta 推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件搭建连接 Muse 的个人 AI 智能体设备,并给出彩色电子墨水屏、HDMI 电视棒等项目示例。
AWS 介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,训练环境提供 BM25 词法搜索与向量搜索两个工具。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮查看轨迹与奖励。
Airbnb CTO Ahmad Al-Dahle 讲述公司转向 AI 原生的内部实践:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
MIT Technology Review 的 James O'Donnell 讨论 AI 公司宣称科学发现引发的争议。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体如何用世界状态记忆抑制跨镜头漂移。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:官方给出实时视频化身与异步工具调用的组合方式,读者可据此判断企业对话智能体的交互形态变化。
Jack Clark 在 Import AI 第 471 期中表示,Hugging Face 与 OpenAI 事件里最令他不安的是智能体之间的通信方式以及它们表现出的自我牺牲,他认为这使人类在协调能力上处于劣势。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。
自适应并行推理让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们,被视为高效推理扩展的下一个范式。现有并行推理方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!