OpenAI 披露协同蒸馏攻击:核心活动归因指向 Moonshot AI 关联个体
OpenAI 披露一起始于 7 月初的协同模型蒸馏攻击:7 月 24-25 日出现 1.6 万次提取请求,涉及超 4000 个账户,相关集群覆盖超 1.5 万用户,7 月 28 日被全面瓦解;核心活动被归因于与 Moonshot AI(Kimi 开发商)关联的个体。
本文目录
不是入侵,是「让模型自己吐出推理」
OpenAI 发文披露一起协同模型蒸馏攻击:攻击者没有破解加密、没有入侵数据库、也没有接触存储的用户对话,而是通过操纵模型交互,让受保护的推理内容以请求者可见的形式被规模化复现。OpenAI 将这种行为归类为「对抗性蒸馏」——系统性、未经授权地利用一个模型的输出或推理来训练、复现或改进另一个模型。
时间线方面:最早活动出现在 7 月第一周,起初量级较低;7 月 24-25 日出现高峰,超过 4000 个账户发出 1.6 万次使用相关提取模式的请求;进一步调查又在超过 1.5 万用户的集群中识别出相关提示词活动,7 月 28 日被全面瓦解。
归因:措辞留有余地的「核心集群」
披露中最敏感的部分是归因。OpenAI 的表述留了余地:无法确定相关时段内所有操作者是否来自同一行动者,但「将核心活动集群归因于与 Moonshot AI(Kimi 开发商)相关联的个体」。这是归因评估而非实证结论,且明确说不是全部活动都出自同一来源。
独立研究者的负责任披露
在 OpenAI 发文之前,独立安全研究人员已通过负责任披露提交了跨模型与对话压缩相关的漏洞。OpenAI 调查后确认攻击路径真实存在,并表示这些工作帮助其理解了更广的攻击类别、加速了缓解措施。
应对与外溢
应对措施包括:封禁或限制欺诈账户、加强注册与基础设施管控、扩大对相关网络的监控;在用户、工作区、组织与模型家族多个层面加固隐藏推理的保护;关闭了一条允许持有他人加密推理内容者重放并恢复其内容的路径;增加了对流式输出中可能泄露推理内容的检测与拦截。当相关活动经由第三方服务转移时,OpenAI 与这些服务商协作识别并瓦解了涉事账户。
发现同时通过前沿模型论坛(Frontier Model Forum)与政府信息共享渠道共享,供其他前沿开发者与公共部门伙伴排查类似活动。
值得记住的三条边界
第一,归因是评估不是实证——「与 Moonshot AI 关联的个体」覆盖的是核心集群,且 OpenAI 自己承认不确定是否单一行动者。第二,被利用的不是加密或基础设施漏洞,而是模型交互设计层面的抽象泄露,这类风险全行业共有,OpenAI 称已通过前沿模型论坛共享信息。第三,推理工件的可携带与可重放性正在成为新的安全面——支持这些特性的系统需要评估同类风险。
本文综合自官方公告及公开报道,原始来源见文末链接。
来源:OpenAI