Hugging Face 发布 funes:为编码智能体提供自有的持久记忆层
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
44 条精选近 30 天 20 条共收录 110 条
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复上的落地方式。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修补,两者沿用 3.7 Flash 的速度与价格,输入每百万 token 0.75 美元、输出 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的取舍。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 完整披露了从预训练到多阶段 RL 的构建流程,可对照了解推理模型与智能体训练的工程取舍。
Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点图,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点与一键部署路径,读者可据此判断多步 AI 流水线如何落地。
Google DeepMind 发文回顾从 Atari、AlphaGo 到 AlphaStar 的 15 年游戏 AI 研究,并宣布与 Fenris Creations 合作,在 EVE 宇宙中推进智能体研究。
推荐理由:DeepMind 回顾十五年游戏 AI 研究脉络,并说明与 Fenris Creations 合作要攻克的持续学习与长时程规划难题。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置在 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准对比,读者可据此判断一次性 RAG 的边界在哪。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型对照实验显示智能体记忆的注入剂量需按模型能力校准,并给出准确率与 token 成本的量化取舍。
Hugging Face 发布《State of Open Models: Summer 2026 Observations》,基于 2026 年 1 至 8 月 Hub 数据给出六项观察。
推荐理由:Hugging Face 用七个月 Hub 数据拆解开源模型格局,下载与点赞的错位、Qwen 生态位和智能体流量变化都可作为判断依据。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:对比 3.6 Flash 的多项基准与半价定价,读者可据此判断编码与智能体工作流的成本变化。
Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。
推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。
IBM 研究团队发布 ALTK-Evolve,与 ACE 同为无需更新权重、无需人工标注的智能体记忆方案,区别在于记忆投递方式。
推荐理由:对比 ACE 与 ALTK-Evolve 两种智能体记忆方案,给出同基准下的准确率与 token 成本差异,便于判断记忆投递方式的影响。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署代码,可据此判断端侧智能体的可用性。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与自动审计工具 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,读者可据此比较自主科研系统在引用与代码一致性上的差异。
Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统完成长周期编程任务的能力,Opus 4.7 用 14 小时、251 美元推理成本解决了一个人类需 2 至 17 周的任务,25 个目标程序中 17 个至少有一次满分运行,但 8 个从未达到 100% 阈值。
推荐理由:汇总 MirrorCode 长周期编程基准、机器人泛化与模型越界三组实验,可对照理解当前智能体能力边界。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的 token 效率、价格与基准对比,可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在多个基准与谷歌内部代码库的实测数据,可了解其能力定位与受限开放方式。
伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。
推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全选项,读者可据此判断智能体自动化的落地路径。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 智能体的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,读者可了解其如何用监督智能体与分级响应约束内部 Agent 风险。