跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

50 条精选近 30 天 19 条共收录 113 条

更新

精选归档 · 第 3 页

7月29日周三第 41–50 条
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 Apple 的 MLX,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库被改写为 Apple Silicon 内核。

    推荐理由:读者可看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。

7月28日周二
7月7日周二
  1. Berkeley AI Research60

    智能免费之后怎么办:面向智能体的数据系统

    伯克利 EPIC Data Lab 的 Aditya G. Parameswaran 等人发布观点文章,提出近零推理成本时代数据系统面临三类新挑战:为智能体设计的数据系统、支撑智能体运行的数据系统、以及由智能体合成的数据系统。

    推荐理由:伯克利团队从推理成本骤降出发,提出智能体时代数据系统的三类新挑战,为理解 Agent 基础设施走向提供框架。

6月30日周二
  1. Google Research73

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中完成预测。

    推荐理由:原文给出 TabFM 的架构设计与 TabArena 基准结果,读者可据此判断零样本表格预测能否替代传统调参流程。

6月27日周六
6月25日周四
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,用纵深防御管控内部 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 智能体的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,读者可了解其如何用监督智能体与分级响应约束内部 Agent 风险。

6月11日周四
6月5日周五
  1. Google Research62

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG 版跨语料检索

    Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。

    推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断复杂查询检索的可行边界。

6月4日周四