跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 3 天前AI 评分67

过度依赖大模型拒绝机制带来的安全隐患与现实困境

We’re putting too much faith in AI’s ability to say no

AI 导读

当前AI安全高度依赖让大模型拒绝有害提示词的对齐机制,但这种基于概率的防御手段存在根本漏洞且容易被绕过。外部分类器与内部激活探针等层层设防推高了算力成本,并引发对正常提问的过度拒绝,却无法彻底剥离模型固有的危险能力。随着技术渗透到关键领域及各国法规介入,拒绝机制还面临沦为言论审查工具以及出现隐蔽非预期抗拒行为的双重风险。

来源:MIT Technology Review · AI · technologyreview.com