Memos WorldMemos World
返回 AI Time

Anthropic 发布研究:训练错位奖励寻求者

研究与安全次要
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。

相关事件

相关主体