Memos WorldMemos World
返回 AI Time

研究:AI 文本水印会让模型更易被有害指令攻破

研究与安全次要
有研究显示,使用文本水印(如 SynthID)后,大模型可能执行其原本会拒绝的有害指令,表明水印机制会改变模型的安全行为。

相关事件

相关主体