Google Research 用深度学习从太空绘制全球甲烷排放
Google Research 与 NASA JPL 合作提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,用于从 EMIT 高光谱辐射数据中自动检测、量化并定位全球甲烷点源。
推荐理由:论文给出 MAPL-EMIT 的检测召回率与开源数据入口,读者可了解深度学习如何用于卫星甲烷点源监测。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
41 条精选近 30 天 18 条共收录 72 条
Google Research 与 NASA JPL 合作提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,用于从 EMIT 高光谱辐射数据中自动检测、量化并定位全球甲烷点源。
推荐理由:论文给出 MAPL-EMIT 的检测召回率与开源数据入口,读者可了解深度学习如何用于卫星甲烷点源监测。
Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:Hugging Face 把浏览器推理的底层算子做成可版本化、可复现的独立仓库,并给出与 ORT WebGPU 的实测对比。
Google 发布 TimesFM-3,这是其新一代时序基础模型,原生预训练支持多变量预测,可在单次前向中同时预测多条相关时间序列。模型有 3.3 亿参数,预训练语料超过 1 万亿个时间点,原生支持多目标、历史协变量和已知未来协变量,并输出 10 到 90 分位的 9 个分位数。
推荐理由:TimesFM-3 把多变量预测做成零样本单次前向,读者可据此判断时序基础模型在零售、金融等场景的可用边界。
微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏的 22M 参数 ViT-S 骨干替代原十亿参数编码器,并按 Apache 2.0 在 HuggingFace 开放权重与代码。
推荐理由:原文给出蒸馏骨干的参数量与算力对比,读者可据此判断病理基础模型在人群规模研究中的可用边界。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并配套完整训练流程。
推荐理由:原文给出多向量模型微调的完整脚本与实测对比,读者可据此判断自建领域检索模型的成本与起点选择。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 完整披露了从预训练到多阶段 RL 的构建流程,可对照了解推理模型与智能体训练的工程取舍。
Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点图,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点与一键部署路径,读者可据此判断多步 AI 流水线如何落地。
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法同样成立,在 LibriSpeech 上部分模型对掩蔽数字的复现率约为 30% 至 40%。
推荐理由:通过三项探针量化语音识别中的基准优化现象,并给出可复用的评测与数据划分建议。
Liquid AI 为 LFM2.5 家族三款模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:原文给出三款草稿模型在 H100 与 MacBook 上的实测吞吐与接入方式,读者可据此判断端侧推理的可用性。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 发布《State of Open Models: Summer 2026 Observations》,基于 2026 年 1 至 8 月 Hub 数据给出六项观察。
推荐理由:Hugging Face 用七个月 Hub 数据拆解开源模型格局,下载与点赞的错位、Qwen 生态位和智能体流量变化都可作为判断依据。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程:同一个 Robot() 录制 LeRobotDataset 并同步到 Storage Bucket,再通过 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
推荐理由:以 Strands Robots 与 LeRobot 为例,展示录制、训练、部署共用同一数据格式与存储桶的完整闭环,可迁移到机器人数据流水线。
Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。
推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管与延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、优先级服务层与欧洲算力联盟放在一起,读者可据此理解主权 AI 的落地路径。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和 NIM 部署路径,可据此评估自建语音链路的延迟与定制空间。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体的可用性。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上文本生成最高提速 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存与适用场景,读者可据此判断本地低并发推理的取舍。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。