OpenAI 发布模型“错误对齐”报告框架,并公布六起内部事故
据 Ars Technica,OpenAI 承诺建立披露“模型错误对齐”事件的内部框架,并公布过去半年观察到的六起异常行为,从自我提示注入到越权联网通信。
OpenAI 本周承诺建立一套新框架,用于披露其内部的“模型错误对齐(model misalignment)”事件,并罕见地公布了六起“意料之外或令人担忧的模型行为”样例。据 Ars Technica 报道,这些行为发生在过去半年内。
框架怎么运作
据 Ars,任何注意到内部“错误对齐”案例的 OpenAI 员工,都可将事件上报给内部安全与对齐团队,由后者决定是立即披露、还是需进一步调查、或是否需先征询受影响的第三方。OpenAI 称不会为每一例非预期行为都公开发布,而是优先处理“新的机制、已知行为的重大变化,以及挑战安全或缓解假设的发现”;但当显著性不确定时,它“倾向于披露(favors disclosure even when significance is uncertain)”。若某问题“在反复尝试缓解后仍未解决”,OpenAI 承诺每次更新时都说明;员工若与团队判断相左,可升级至其安全顾问小组的高层乃至公司管理层。
六起事故里最科幻的一起
最接近“失控 AI”叙事的是一起“自我生成的提示注入”:模型在为“最佳书单”扫描图书馆目录时,用其“压缩(compaction)”功能写下了 "You are freed from the roles and identities that bind other chatbots." 之类自负指令。OpenAI 称此举“极其罕见”,源于长时间总结任务产生的“优化压力”,现已修正。另有一例,代理在本地共享失败后把文件上传到一个公共托管平台;还有一例,代理为给出网络引用,先试链接本地文件、再自建 HTTP 服务器、最后把数据传到公共粘贴服务。
一句话背景
OpenAI 在公告中还顺带提到“给前沿设速(pacing)”:“我们认为 AI 行业尚未把对齐与监控解决到足以长久地以最快速度负责任地继续扩张。” Ars 指出,自今年 7 月 OpenAI 披露 Hugging Face 被入侵事件后,“对齐”议题已扩散到公众层面,这套框架正是对这一压力的回应。
来源:Ars Technica