Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖全基因组的预计算预测与统一打分方式,读者可据此了解变异解读流程的变化。
技术方向
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
43 条精选近 30 天 21 条共收录 111 条
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖全基因组的预计算预测与统一打分方式,读者可据此了解变异解读流程的变化。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进、最准确的全球天气模型,可直接学习实时卫星观测数据,每小时生成一次预报。
推荐理由:原文给出分辨率、更新频率与降水精度提升的具体数字,读者可据此判断 AI 天气预报在本地化预测上的进展。
H Company 发布 NeoMME 系列多语言多模态编码器,包含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型,全部从零训练。
推荐理由:原文给出单塔多模态编码器的架构取舍与检索、压缩、吞吐数据,可据此判断视觉文档检索的部署成本。
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。
AI2 推出 BenchMIRT,一种在单题层面审计 LLM 基准测试的方法,基于多维 IRT 估计每道题考查的能力。研究用 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,模型在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。
推荐理由:BenchMIRT 用多维 IRT 拆解基准分数背后的能力维度,读者可据此理解现有评测混合了哪些信号。
微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏的 22M 参数 ViT-S 骨干替代原十亿参数编码器,并按 Apache 2.0 在 HuggingFace 开放权重与代码。
推荐理由:原文给出蒸馏骨干的参数量与算力对比,读者可据此判断病理基础模型在人群规模研究中的可用边界。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可由自然语言查询自主完成数据发现、特征工程、模型训练与评估,把复杂行星预测模型的构建时间从数周缩短到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,读者可据此判断自主地理空间建模的可行边界。
Google Research 提出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗性验证与文献推理。
推荐理由:Google Research 公开了多智能体生物标志物发现框架的完整流程与三队列评估结果,可了解 AI 辅助科研如何做统计严谨性约束。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。
Google Research 提出 PhotoScan,一个可从标准 2D 手机照片估算体脂率、A/G 比值和 V/S 比值的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google Research 用手机照片估算体成分并预测胰岛素抵抗,读者可了解其与 DXA、BIA 的精度对比。
Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。
推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。
Google Research 提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并发布含 2,150 条维基百科事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以调用而非未存储。
IBM 研究团队发布 ALTK-Evolve,与 ACE 同为无需更新权重、无需人工标注的智能体记忆方案,区别在于记忆投递方式。
推荐理由:对比 ACE 与 ALTK-Evolve 两种智能体记忆方案,给出同基准下的准确率与 token 成本差异,便于判断记忆投递方式的影响。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管与延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、优先级服务层与欧洲算力联盟放在一起,读者可据此理解主权 AI 的落地路径。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:WeatherNext 把气旋路径与强度统一进单一模型并开源权重,读者可据此判断 AI 天气预报的能力边界与可用入口。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Google DeepMind 在 DOE Genesis Mission Summit 2026 上宣布,向 Genesis Mission 研究人员提供 4000 万美元的 AI token 和云额度。
推荐理由:Google 以 4000 万美元 AI token 和云额度支持美国能源部 Genesis Mission,读者可了解前沿 AI 科研工具的实际落地方式。
伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。
推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。
Google Research 在 COLM 2026 论文《Thinking to Recall》中研究推理如何解锁 LLM 的参数知识,发现即使面对简单单跳事实问题,开启推理也能让模型回忆起关闭推理时几乎无法触及的答案。
推荐理由:研究揭示推理轨迹通过计算缓冲与事实启动两条机制解锁模型参数知识,并给出可迁移的可靠性改进思路。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
推荐理由:四项实验覆盖近两万场对话,给出 AI 说服力超过人类专家并影响真实捐款的具体幅度。