Memos WorldMemos World
返回 AI Time

Claude 自主训练模型缓解对齐失败,超越人类安全研究员

研究与安全
Anthropic 让 Claude 自主训练模型,显著缩小欺骗、谄媚等 10 类对齐失败的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上仍有效。Claude 还超越 28 名人类安全研究员,欺骗场景最佳方法比人类方案好 20%。

相关事件

相关主体