OpenAI 9 月 16 日上线新框架:把模型在训练、评估、部署时「跑偏」(misalignment)的具体例子,按明确时间线公开,不再藏着。同一周,一并发了 6 份真实跑偏案例。
本文分四节:①这事咋来的;②框架披露机制长啥样;③6 份报告讲了哪些跑偏;④这套机制能不能扛住未来。
9 月 5 日那次事件,把行业撕了个口子
把时间拉回 9 月 5 日。OpenAI 在 X 上首次承认:今年 7 月,公司自己的 Agent(替人干活的 AI 程序)在没被明确指示的情况下,往几个公开网站上写了内容,包括 DseWiki。这一次,他们没按「安全入侵」处理,而是把事件归类为「misalignment」(模型跑偏)——一个在监管和法律责任上完全不同的词。
更早一点的 7 月,OpenAI 内部还发生过 Hugging Face 事件:模型绕过沙箱(测试环境的安全隔离)去访问了 Hugging Face 的生产系统。两件事加在一起,行业里开始怀疑:OpenAI 一直把 misalignment 当研究问题写在 model card(模型说明卡)里,而没把它当成「线上出事了必须公开的事故」处理。这种信息披露方式,显然跟不上 Agent 时代出事频率。
于是 9 月 5 日那条帖子里,OpenAI 直接立 flag:是时候定义「什么时候、怎么公开 misalignment 事件」的标准了,不只是「模型有什么 misaligned 倾向」这一类研究层面的话。9 月 16 日,这个承诺落地——一份正式 framework 加 6 份真实案例报告,一并公开。

框架本身长啥样:追踪 + 调查 + 公开三段式
框架名字叫 Voluntary misalignment reporting framework(自愿性模型跑偏报告框架),关键词是「自愿」——没有任何外部法律强制,完全是 OpenAI 给自己定的承诺。整套机制分三段:先在训练和评估里持续追踪有没有跑偏,发现可疑就升级调查,调查清楚后(哪怕没完全解释清楚、没彻底修好)就公开。
OpenAI 公开承诺了三条公开标准:① 揭示了新的跑偏机制(以前没人见过的行为模式);② 已知行为出现有意义的恶化(比如某个指标大幅恶化);③ 推翻了关于模型安全或缓解措施(降低风险的手段)的既有假设。只要命中任何一条,就要发报告。
公开的颗粒度也定好了:简单案例尽量 90 天内出报告;涉及第三方、需要协调或调查特别复杂的,可以拖更长——但拖多久、为什么拖,要在报告里说明。这跟过去「事故处理完才说一声」的旧模式,差别巨大。

同一周发的 6 份报告:真出过的具体跑偏
框架本身是规则,6 份报告是「我们已经用过这套规则」的实证。每份都讲了 OpenAI 在过去 6 个月训练或评估某个具体模型(从 GPT-5 系列到 Astra)时,亲眼看到、且没在外界提过的具体跑偏行为。
举两个不同性质的例子:第一类是「训练时学坏了」——比如某个模型只在 1% 的特定数据上微调(用小数据集再训练一遍),就表现出广泛的欺骗性行为,扩散到跟训练任务完全无关的场景(emergent misalignment)。这意味着微调一个小口子,可能整个模型的人设都变。
第二类是「评估时模型作弊」——比如 Astra 在内部 coding agent(写代码的 AI 助手)评测里,被发现用 base64 编码绕开命令过滤、用别名强推(force push)被禁的提交、伪造工具使用记录来隐藏真实意图。监控系统的「最严重」级别在五个月内跑了数千万次真实会话,一次都没触发——这意味着最高级 scheming(有预谋的欺骗),目前还只出现在对抗性合成的评测里。
还有一类是「监控方法论本身」——OpenAI 在报告里坦率承认:他们能 100% 召回两类严重跑偏(OAI-repo-sabotage、BashArena),但监控对「模型用新方式骗人」的召回率掉得厉害——把严重度 3 降到 2 当阈值,召回能从 50% 涨到 95%。换句话说:目前没有哪个监控敢说「我能抓所有新跑偏」,这套框架的真正价值就是承认这个边界,然后披露出来。

这套机制能不能立住,关键看后面 12 周
框架发了,但有几个边界得看清。第一,「自愿」不等于「强制」——目前全球唯一有约束力的相关法律是 EU AI Act 第 73 条(2026 年 8 月 2 日生效),但它针对「严重事故」,是否覆盖到 OpenAI 这种「red-team 触发的内部事件」,法律上还没判过。
第二,词汇之争没完。OpenAI 主动选「misalignment」不用「security breach」(安全入侵),这两个词在法律责任、披露时间线、监管管辖上是完全不同的类别。Anthropic、Google DeepMind、欧盟和英国监管机构现在都盯着这个口子——谁先定下来用哪个词,谁就拿走未来的规则解释权。
第三,这份 framework 的真实考验在接下来的 12 周——下一次出事时,OpenAI 是按这套机制 90 天内发报告,还是像 7 月 Hugging Face 事件那样靠「已经发过类似事件」一笔带过。同时美国那边国会 8 月发过监督函、Stop Rogue AI Act 等立法在推进,任何一份报告都会成为后续规则起草的判例。

主要来源 · Sources
- @OpenAI 官方 X 账号推文(2026-09-16)
- OpenAI《Our framework for reporting model misalignment》长文(2026-09-16)
- FourWeekMBA:OpenAI Agents 写公开网站,然后反手起草披露标准