跳到正文
  1. Google DeepMind66

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来持久化、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。

    推荐理由:Google 给出私有 AI 计算新增持久化服务端记忆的架构说明,读者可了解云端长期上下文如何与端侧隐私标准结合。

  1. OpenAI News60

    OpenAI 为 GPT-6 改进提示词缓存

    OpenAI 宣布 GPT-6 改进了提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。

    推荐理由:官方披露 GPT-6 提示词缓存的命中率、诊断与断点控制变化,可据此评估延迟与成本影响。

  1. Hugging Face Blog62

    Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

    Hugging Face 在 transformers 中加入 GGUF 支持,用户可从 Hub 选取 GGUF 检查点,用 from_pretrained 传入 gguf_file 即可在本地生成,无需额外配置。

    推荐理由:Hugging Face 官方给出在 transformers 中直接加载 GGUF 的用法与与 llama.cpp 的对比数据,可据此判断本地推理工作流的变化。

  1. Hugging Face Blog62

    Hugging Face 发布 tokenizers v1 候选版,编码速度最高提升 30 倍

    Hugging Face 发布 tokenizers v1 候选版,在 Apple M4 Max 单线程下对十类模型的编码速度比 v0.23 快 3 至 30 倍,八线程扩展效率为线性的 76%,且输出 token ID 与旧版完全一致。

    推荐理由:原文给出 v1 相对 v0.23 的加速幅度、实现改动与安装方式,可据此判断是否值得替换现有 tokenizer。

  1. Google DeepMind78

    Google DeepMind 在 Gemini 3.5 Flash 中内置 computer use 能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。

    推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全选项,读者可据此判断智能体自动化的落地路径。

  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 锚定能力,可基于美国真实地点影像生成可交互世界,并支持选择 Desert Sands、Stone Age、Ocean World、B&W film 等风格。

    推荐理由:原文说明 Genie 如何用 Street View 真实影像为生成世界提供地理锚点,读者可了解世界模型落地路径。

已经到底了