跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

41 条精选近 30 天 18 条共收录 72 条

更新

精选归档 · 第 2 页

9月2日周三第 21–40 条
9月1日周二
  1. Hugging Face Blog62

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核与 Fleet 测试套件

    Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。

    推荐理由:Hugging Face 把浏览器推理的底层算子做成可版本化、可复现的独立仓库,并给出与 ORT WebGPU 的实测对比。

  2. Google Research62

    Google 发布 TimesFM-3:面向多变量预测的零样本基础模型

    Google 发布 TimesFM-3,这是其新一代时序基础模型,原生预训练支持多变量预测,可在单次前向中同时预测多条相关时间序列。模型有 3.3 亿参数,预训练语料超过 1 万亿个时间点,原生支持多目标、历史协变量和已知未来协变量,并输出 10 到 90 分位的 9 个分位数。

    推荐理由:TimesFM-3 把多变量预测做成零样本单次前向,读者可据此判断时序基础模型在零售、金融等场景的可用边界。

  3. Microsoft Research62

    微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏的 22M 参数 ViT-S 骨干替代原十亿参数编码器,并按 Apache 2.0 在 HuggingFace 开放权重与代码。

    推荐理由:原文给出蒸馏骨干的参数量与算力对比,读者可据此判断病理基础模型在人群规模研究中的可用边界。

8月26日周三
8月25日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B/8B/30B 三尺寸与构建流程

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。

    推荐理由:Granite 4.2 完整披露了从预训练到多阶段 RL 的构建流程,可对照了解推理模型与智能体训练的工程取舍。

  2. Hugging Face Blog62

    Gradio 推出 gr.Workflow:把 AI 流水线做成可拖拽画布并自动生成 REST API

    Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点图,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点图、REST 端点与一键部署路径,读者可据此判断多步 AI 流水线如何落地。

8月21日周五
  1. Hugging Face Blog66

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法同样成立,在 LibriSpeech 上部分模型对掩蔽数字的复现率约为 30% 至 40%。

    推荐理由:通过三项探针量化语音识别中的基准优化现象,并给出可复用的评测与数据划分建议。

  2. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族三款模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:原文给出三款草稿模型在 H100 与 MacBook 上的实测吞吐与接入方式,读者可据此判断端侧推理的可用性。

  3. Microsoft Research62

    微软研究院发布 Skala 1.1,并集成到 CP2K 等电子结构软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。

    推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。

8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

8月14日周五
  1. Hugging Face Blog62

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 完成录制、训练与部署闭环

    Hugging Face 博客给出 Strands Robots 的流式数据闭环教程:同一个 Robot() 录制 LeRobotDataset 并同步到 Storage Bucket,再通过 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。

    推荐理由:以 Strands Robots 与 LeRobot 为例,展示录制、训练、部署共用同一数据格式与存储桶的完整闭环,可迁移到机器人数据流水线。

8月13日周四
  1. Hugging Face Blog75

    Hugging Face 用智能体复现 2,226 篇 ICML 2026 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先级服务层,并组建欧洲算力联盟

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管与延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、优先级服务层与欧洲算力联盟放在一起,读者可据此理解主权 AI 的落地路径。

  2. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言开源权重模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖、TTFA 实测数据和 NIM 部署路径,可据此评估自建语音链路的延迟与定制空间。

8月10日周一
7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。

    推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。

6月11日周四
6月9日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。