← 返回 AI Time2026年9月30日ArenaArena 研究:LLM 裁判偏爱自身答案比人类高约 70%研究与安全次要Arena 用 12 个模型对 1,460 场真实 Text Arena 对战做出 34,580 条裁决,发现模型偏爱自身答案的程度平均比人类高约 70%,GPT-6 Astra 在 88% 的对战中选了自己。AI 裁判之间一致率为 79.4%,但与人类投票者仅 56.9%。来自 x.com ↗相关事件2026年9月29日Arena:GPT-6 Luna (Max) 位列 Agent Arena 第 23 名2026年9月29日Claude Sonnet 5.5 上线 Arena 的 Agent Arena 与 Battle Mode2026年9月29日Claude Opus 5.5 进入 Agent Arena 排名第 22026年9月27日Claude Opus 5.5 登顶 Arena Text Arena 榜首2026年9月26日Arena 发布 Claude Opus 5.5 写作指标分析相关主体Arena查看时间线 →