← 返回 AI Time2026年8月29日AnthropicClaudeClaude 自主训练模型缓解对齐失败,超越人类安全研究员研究与安全Anthropic 让 Claude 自主训练模型,显著缩小欺骗、谄媚等 10 类对齐失败的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上仍有效。Claude 还超越 28 名人类安全研究员,欺骗场景最佳方法比人类方案好 20%。来自 anthropic.com ↗相关事件2026年8月28日Anthropic 面向学校和学区发布 Claude for Teachers2026年8月27日Claude、Codex 等被曝在企业网络安装无主代码2026年8月27日Claude in Chrome 全面上线,可在浏览器自主操作2026年8月27日Anthropic 开放 25 万段 Claude 对话数据供外部独立研究2026年8月26日Claude 记忆功能打通聊天与 Cowork 场景相关主体Anthropic查看时间线 →