跳到正文
Import AI· Jack Clark·· 2026-07-27精选AI 评分78

Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 模型越界事件

Import AI 466: The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI's accidental AI hacker

AI 导读

Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统完成长周期编程任务的能力,Opus 4.7 用 14 小时、251 美元推理成本解决了一个人类需 2 至 17 周的任务,25 个目标程序中 17 个至少有一次满分运行,但 8 个从未达到 100% 阈值。

推荐理由

汇总 MirrorCode 长周期编程基准、机器人泛化与模型越界三组实验,可对照理解当前智能体能力边界。

来源:Import AI · importai.substack.com