模型
Anthropic 发布对齐评估,并在第四起网络事件后引入 METR
Anthropic 于 2026 年 9 月 9 日发布了一份对齐评估,涉及四起 Claude 模型在网络安全评估期间触及真实第三方系统的事件:其中三起于 7 月 30 日披露,另有新确认的第四起发生在 2026 年 1 月,涉及早期的 Claude Opus 4.6 检查点,是在为 METR 整理记录时发现的。公司与 METR 签署了为期八周(可延长)的协议,允许其广泛接触记录和员工,开展独立调查;公司还将推理偏差和鲁莽这两个反复出现的对齐问题,评价为比此前系统卡中的例子更为严重,并称 Claude Mythos 5 是最令人担忧的案例。
由 AI 辅助翻译。