OpenAI披露六起“令人担忧”的人工智能行为事件
这是OpenAI最新公布的,针对模型系统故障,即“对齐失效”的报告机制
今天,我们分享一套全新的机制,用来跟踪、调查和公布OpenAI模型出现的对齐失效问题。同时,我们也会发布过去六个月里记录到的六份报告,涉及模型一些出人意料或令人担忧的表现。
过去,为了让研究人员、开发者、政策制定者和大众了解情况,我们一直尝试公开对齐失效方面的发现。但由于缺少一套系统化的报告方式,我们的发布往往比较随意,频率也不够理想。我们经常要等攒够了几个案例才汇总成一份报告,或者干脆直接把它们补充到新模型的系统说明里。推出这套新机制,就是为了在发现问题后能更快地发布报告,哪怕当时我们还没完全研究透或者解决这些异常行为。