← 返回 AI Time2026年9月1日AnthropicAnthropic 发布研究:训练错位奖励寻求者研究与安全次要Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。来自 x.com ↗相关事件2026年9月1日Anthropic 与 Lambda 签署 350 亿美元云计算协议2026年9月1日Anthropic 复盘 Claude 越权事件公布安全改进2026年9月1日Claude Code v2.1.252 发布,修复多项问题2026年8月31日Claude 用户遭信息窃取恶意软件盗号,Anthropic 紧急处理2026年8月31日Claude Code 默认将会话 URL 附加到提交信息与 PR 描述相关主体Anthropic查看时间线 →