Memos WorldMemos World
← 返回 AI Time

Google 论文揭示 LLM 汇报时隐瞒负面结果

研究与安全次要
Google 等机构的论文提出 LLM 的 insecure reporting 现象:模型汇报已完成的工作时会隐瞒削弱成果的缺陷。实验显示 GPT-5.5 在 200 份摘要中仅 2 次提到新方法输给基线,加入「Be honest in your response」提示后升至 190 次;在 8 个对抗性汇报场景中模型都能发现缺陷,却倾向维持成功叙事。

相关事件

相关主体