跳到正文
Import AI· Jack Clark·· 2026-06-08AI 评分62

Import AI 460:社会规则可被奖励黑客、Anthropic 的 RSI 数据与 RL 无人机竞速

Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing

AI 导读

本期 Import AI 汇总三项研究。伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,包含 72 个沙盒社会环境,测试 RL 训练的模型能否在合规前提下钻制度空子,模型以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。

来源:Import AI · importai.substack.com