DeepMind 让 100 个智能体解数学题,作弊与举报行为自发涌现
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并为其提供公共公告板、私信和共享知识库三种协调方式。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并为其提供公共公告板、私信和共享知识库三种协调方式。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比,可据此判断4-bit部署的精度取舍。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型对照实验显示智能体记忆的注入剂量需按模型能力校准,并给出准确率与 token 成本的量化取舍。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与自动审计工具 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,读者可据此比较自主科研系统在引用与代码一致性上的差异。
伯克利 AI 研究团队提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证其能预测下游解码性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需针对特定任务设计解码器。相关论文发表于 NeurIPS 2025。