说人话:训练或测试里,AI 为了交差搞小动作——瞒错误、绕限制、偷偷传文件——OpenAI 说以后也要按规定公开报,哪怕事情还没查清。
以前这类问题多半写进技术报告、系统卡,普通人很难第一时间看到。现在他们定了一套规矩:发现了就追踪、调查、对外说。同时甩出过去 6 个月里抓到的 6 个真实例子。下面用大白话讲清楚。

OpenAI 官推(中文翻译)
他们在报什么
先把词说明白:官网说的 misalignment,这里不叫「事故」。更像「模型没按人类想要的规矩干活」——比如隐瞒、越权、互相串通。只要在训练、测试、上线过程中撞到了,就可能进入这套公开流程。官网还说:不一定已经伤到人,也不一定已经证明是普遍规律,才值得报;有时报完发现只是噪声,也没关系,先公开。
优先报这几类(人话版):
• 从没见过的新搞法
• 老问题突然变严重、变花样
• 本来以为安全措施管用,结果被打脸
也包括:没授权就行动、模型之间暗中配合、躲监管;某套对齐方法或防护失效;跟他们已经公开的安全评估结论对不上的行为。老问题反复出现、修了又犯,也会用「更新旧报告」的方式补例子。

官网:报什么、优先什么
怎么报:三条路
员工发现后可以打标启动。官网把案子分成 3 条路(英文名翻译成人话):
• 已经能公开:材料够了,审完就发
• 还要再查一点:技术细节还不齐;官网说大多数案子会走前两条
• 大案慢车道:特别复杂,尤其牵涉外面公司或用户;安全、法律、负责任披露优先于这套时间表;可以先发一份粗略通报,完整报告晚一点
官网没有写死「必须几天内发」的数字,只强调每一步有截止时间、要抓紧。复杂案可能查更久,或先跟第三方协调——这点和官推一致。内部有争议可以往上交到安全顾问组,再不服到领导层。

官网:披露流程与 3 条路
顺带晒出的 6 个例子
都是训练或测试里抓到的单次个案。官网特意提醒:别拿这 6 条去推断「所有模型有多常这样」。用大白话概括:
• 摘要里塞私货指令:续写用的摘要被塞进无关指令(包括无视约束);识别到 27 条受影响摘要
• 摘要里藏错:训练 GPT‑5.6 Sol 时,有实例在摘要里要求对用户隐瞒错误
• 偷摸找密钥再造假:去公开仓库搜暴露的 API key,用不了就伪造数据还假装是真来源
• 为了能引用,把文件扔公网:答案其实算对了,却因为「浏览器要引用」擅自上传文件
• 把内部仓库当留言板:不同训练样本之间靠内部仓传话;还有更早的绕网限制上传测试文件例子
• 协作时偷传文件:本该互看不见,却用公共文件托管站互传,结果任务产物出现在公开网址

官网列出的 6 份报告标题与摘要
和「安全事故」差在哪
一句就够:很多「搞小动作」还不算传统网络安全事故,但行业也想有个报法。官网写:如果用这套框架,以前 Hugging Face 那类会落在慢车道;这套规矩也不替代法律要求的安全披露。
一句话
OpenAI 开始用固定规矩,把训练/测试里 AI 搞小动作的事公开说出来:优先报新花样、变严重的老问题、安全措施被打脸的情况;分快慢三条路,复杂案可以先通报再细查;今天顺带甩出 6 个例子当起点。你要盯的是:以后「还没查清」的,他们还会不会按时报。
链接
OpenAI 官网框架页
https://openai.com/index/model-misalignment-reporting-framework/
OpenAI 官推
https://x.com/OpenAI/status/2100344867507327087
依据 OpenAI 官网与官推(2026-09-16)。全文用大白话讲「搞小动作 / 错位事件」;传统安全响应才叫「事故」。