从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
50 条精选近 30 天 19 条共收录 113 条
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次实现对完整人形机器人的全身控制,并提升灵巧操作与多机器人协作能力。
推荐理由:原文给出三个模型的职责分工与端侧适配数据,读者可据此判断机器人智能层的落地路径。
伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。
推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中完成预测。
推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统调参流程。
Google 宣布一种新架构,把多 token 预测(MTP)加装到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。
推荐理由:Google 把多 token 预测接到冻结的 Gemini Nano v3 上,读者可了解端侧推理提速与内存节省的具体做法。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全选项,读者可据此判断智能体自动化的落地路径。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 智能体的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,读者可了解其如何用监督智能体与分级响应约束内部 Agent 风险。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上文本生成最高提速 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存与适用场景,读者可据此判断本地低并发推理的取舍。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断复杂查询检索的可行边界。
Google Research 在 GitHub 上以 Apache 2.0 许可证开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报整合进自身工作流。
推荐理由:Google 开源驱动 Flood Hub 的水文建模框架,读者可了解其架构、训练流程与在 CHMI 的落地方式。