跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

44 条精选近 30 天 20 条共收录 110 条

更新

精选归档 · 第 2 页

9月3日周四第 21–40 条
  1. Hugging Face Blog74

    Hugging Face 发布 funes:为编码智能体提供自有的持久记忆层

    Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes。它以单个二进制安装,默认在本地完成嵌入与重排序,无需 ML 运行时依赖,一条 add 命令即可为智能体建立索引并接入 recall 与 get 工具。

    推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨智能体、跨机器的上下文延续方式。

  2. Google DeepMind66

    Google DeepMind 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复上的落地方式。

  3. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修补,两者沿用 3.7 Flash 的速度与价格,输入每百万 token 0.75 美元、输出 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的能力、定价和开放入口,可据此判断长程编码与安全场景的取舍。

8月25日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B/8B/30B 三尺寸与构建流程

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。

    推荐理由:Granite 4.2 完整披露了从预训练到多阶段 RL 的构建流程,可对照了解推理模型与智能体训练的工程取舍。

  2. Hugging Face Blog62

    Gradio 推出 gr.Workflow:把 AI 流水线做成可拖拽画布并自动生成 REST API

    Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点图,每个节点可运行、中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点图、REST 端点与一键部署路径,读者可据此判断多步 AI 流水线如何落地。

8月21日周五
8月20日周四
8月19日周三
  1. Hugging Face Blog67

    IBM Research 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对照实验显示智能体记忆的注入剂量需按模型能力校准,并给出准确率与 token 成本的量化取舍。

8月14日周五
8月13日周四
  1. Hugging Face Blog75

    Hugging Face 用智能体复现 2,226 篇 ICML 2026 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2,226 篇 ICML 论文的复现结果与判定数据,读者可据此了解智能体做科研复现的边界与人的角色。

8月11日周二
8月10日周一
7月31日周五
7月27日周一
  1. Import AI78

    Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 模型越界事件

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统完成长周期编程任务的能力,Opus 4.7 用 14 小时、251 美元推理成本解决了一个人类需 2 至 17 周的任务,25 个目标程序中 17 个至少有一次满分运行,但 8 个从未达到 100% 阈值。

    推荐理由:汇总 MirrorCode 长周期编程基准、机器人泛化与模型越界三组实验,可对照理解当前智能体能力边界。

7月21日周二
7月17日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

    推荐理由:官方给出轻量安全模型在多个基准与谷歌内部代码库的实测数据,可了解其能力定位与受限开放方式。

7月7日周二
  1. Berkeley AI Research60

    智能免费之后怎么办:面向智能体的数据系统

    伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。

    推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。

6月25日周四
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,用纵深防御管控内部 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 智能体的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,读者可了解其如何用监督智能体与分级响应约束内部 Agent 风险。