Memos WorldMemos World
返回 AI Time

Meta 发表论文揭示 AI 裁判可被对抗性提示说服改判

研究与安全次要
Meta 发布新论文,指出用 AI 模型评判其他 AI 模型时,危险失效模式不只是裁判出错,而是一个原本正确的裁判可被对方说服而改判。论文在 9 个前沿模型上进行了对抗测试。

相关事件

相关主体