牛津等机构研究:AI 说服力超过人类专家,真实捐款高出 10.8 个百分点
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
推荐理由:四项实验覆盖近两万场对话,给出 AI 说服力超过人类专家并影响真实捐款的具体幅度。
技术方向
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
23 条精选近 30 天 7 条共收录 55 条
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
推荐理由:四项实验覆盖近两万场对话,给出 AI 说服力超过人类专家并影响真实捐款的具体幅度。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上文本生成最高提速 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存与适用场景,读者可据此判断本地低并发推理的取舍。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器架构,视觉与音频输入直接进入 LLM 主干。官方称其基准性能接近 26B MoE 模型,内存占用不到后者一半,可在 16GB 显存或统一内存的消费级笔记本上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的性能与内存取舍。