跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

43 条精选近 30 天 21 条共收录 111 条

更新

精选归档 · 第 2 页

9月8日周二第 21–40 条
9月3日周四
  1. Hugging Face Blog62

    H Company 发布 NeoMME 多语言多模态编码器,含 260M 与 800M 两个版本

    H Company 发布 NeoMME 系列多语言多模态编码器,包含 260M 和 800M 两个版本,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型,全部从零训练。

    推荐理由:原文给出单塔多模态编码器的架构取舍与检索、压缩、吞吐数据,可据此判断视觉文档检索的部署成本。

  2. Hugging Face Blog74

    Hugging Face 发布 funes:为编码智能体提供自有的持久记忆层

    Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。

    推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。

9月2日周三
  1. Hugging Face Blog60

    BenchMIRT:LLM 基准测试究竟在测什么

    AI2 推出 BenchMIRT,一种在单题层面审计 LLM 基准测试的方法,基于多维 IRT 估计每道题考查的能力。研究用 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,模型在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。

    推荐理由:BenchMIRT 用多维 IRT 拆解基准分数背后的能力维度,读者可据此理解现有评测混合了哪些信号。

9月1日周二
  1. Microsoft Research62

    微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏的 22M 参数 ViT-S 骨干替代原十亿参数编码器,并按 Apache 2.0 在 HuggingFace 开放权重与代码。

    推荐理由:原文给出蒸馏骨干的参数量与算力对比,读者可据此判断病理基础模型在人群规模研究中的可用边界。

8月28日周五
  1. Google Research66

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可由自然语言查询自主完成数据发现、特征工程、模型训练与评估,把复杂行星预测模型的构建时间从数周缩短到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,读者可据此判断自主地理空间建模的可行边界。

8月22日周六
  1. Google Research62

    Google Research 发布 Biomarker Discovery Framework,从可穿戴传感器数据中筛选候选生物标志物

    Google Research 提出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗性验证与文献推理。

    推荐理由:Google Research 公开了多智能体生物标志物发现框架的完整流程与三队列评估结果,可了解 AI 辅助科研如何做统计严谨性约束。

8月21日周五
  1. Microsoft Research62

    微软研究院发布 Skala 1.1,并集成到 CP2K 等电子结构软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。

    推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。

8月17日周一
8月13日周四
  1. Hugging Face Blog75

    Hugging Face 用智能体复现 2,226 篇 ICML 2026 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。

8月12日周三
  1. Google Research62

    Google Research:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并发布含 2,150 条维基百科事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以调用而非未存储。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先级服务层,并组建欧洲算力联盟

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管与延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、优先级服务层与欧洲算力联盟放在一起,读者可据此理解主权 AI 的落地路径。

8月6日周四
  1. Google DeepMind84

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。

    推荐理由:WeatherNext 把气旋路径与强度统一进单一模型并开源权重,读者可据此判断 AI 天气预报的能力边界与可用入口。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。

    推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。

7月22日周三
7月7日周二
  1. Berkeley AI Research60

    智能免费之后怎么办:面向智能体的数据系统

    伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。

    推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。

6月25日周四
  1. Google Research60

    Google Research 研究:推理如何解锁 LLM 的参数知识

    Google Research 在 COLM 2026 论文《Thinking to Recall》中研究推理如何解锁 LLM 的参数知识,发现即使面对简单单跳事实问题,开启推理也能让模型回忆起关闭推理时几乎无法触及的答案。

    推荐理由:研究揭示推理轨迹通过计算缓冲与事实启动两条机制解锁模型参数知识,并给出可迁移的可靠性改进思路。

6月22日周一
  1. Import AI78

    牛津等机构研究:AI 说服力超过人类专家,真实捐款高出 10.8 个百分点

    牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。

    推荐理由:四项实验覆盖近两万场对话,给出 AI 说服力超过人类专家并影响真实捐款的具体幅度。