跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分50

我们是否过度信任 AI 说“不”的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,AI 的拒绝机制正成为安全体系的关键承重墙,但这一机制并不可靠。Anthropic 2021 年提出模型应“有用、诚实、无害”,如今模型经大量拒绝训练后仍保留有害能力,且拒绝机制具有概率性,可能被绕过。文章还提到 OpenAI 曾组织红队测试 ChatGPT,并警告拒绝边界由企业划定,政府介入后可能被用于压制合法言论。

来源:MIT Technology Review · AI · technologyreview.com