跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

23 条精选近 30 天 7 条共收录 55 条

更新

精选归档 · 第 2 页

6月22日周一第 21–23 条
  1. Import AI78

    牛津等机构研究:AI 说服力超过人类专家,真实捐款高出 10.8 个百分点

    牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。

    推荐理由:四项实验覆盖近两万场对话,给出 AI 说服力超过人类专家并影响真实捐款的具体幅度。

6月11日周四
6月9日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。