Hugging Face 发布 funes:为编码智能体提供自有的持久记忆层
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
50 条精选近 30 天 19 条共收录 113 条
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复上的落地方式。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及可用入口,读者可据此判断长视频分析的成本结构变化。
Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:Hugging Face 把浏览器推理的底层算子做成可版本化、可复现的独立仓库,并给出与 ORT WebGPU 的实测对比。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可由自然语言查询自主完成数据发现、特征工程、模型训练与评估,把复杂行星预测模型的构建时间从数周缩短到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,读者可据此判断自主地理空间建模的可行边界。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出流式与非流式两套 API 的 WER 与延迟数据,可据此判断语音转写能否接入现有开发流程。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比,可据此判断4-bit部署的精度取舍。
Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点图,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点与一键部署路径,读者可据此判断多步 AI 流水线如何落地。
Liquid AI 为 LFM2.5 家族三款模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:原文给出三款草稿模型在 H100 与 MacBook 上的实测吞吐与接入方式,读者可据此判断端侧推理的可用性。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol。Skala 已在 CP2K 中可用,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:Skala 1.1 用 2.5 倍训练数据提升精度,并给出多款电子结构软件的集成进展与性能基准。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置在 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准对比,读者可据此判断一次性 RAG 的边界在哪。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 发布《State of Open Models: Summer 2026 Observations》,基于 2026 年 1 至 8 月 Hub 数据给出六项观察。
推荐理由:Hugging Face 用七个月 Hub 数据拆解开源模型格局,下载与点赞的错位、Qwen 生态位和智能体流量变化都可作为判断依据。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程:同一个 Robot() 录制 LeRobotDataset 并同步到 Storage Bucket,再通过 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
推荐理由:以 Strands Robots 与 LeRobot 为例,展示录制、训练、部署共用同一数据格式与存储桶的完整闭环,可迁移到机器人数据流水线。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:对比 3.6 Flash 的多项基准与半价定价,读者可据此判断编码与智能体工作流的成本变化。
IBM 研究团队发布 ALTK-Evolve,与 ACE 同为无需更新权重、无需人工标注的智能体记忆方案,区别在于记忆投递方式。
推荐理由:对比 ACE 与 ALTK-Evolve 两种智能体记忆方案,给出同基准下的准确率与 token 成本差异,便于判断记忆投递方式的影响。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,以匹配数据驻留、监管与延迟要求;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、优先级服务层与欧洲算力联盟放在一起,读者可据此理解主权 AI 的落地路径。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体的可用性。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:WeatherNext 把气旋路径与强度统一进单一模型并开源权重,读者可据此判断 AI 天气预报的能力边界与可用入口。
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出视频理解、任务编排与多机协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。