OpenAI 周三宣布了一项新框架,用于公开披露人工智能错位事件,该公司表示希望这有助于为全行业制定类似标准提供参考。

该公司还发布了有关过去一年中识别出的几个 AI 模型错位实例的新信息。

“随着模型的进步和更广泛的部署,关于 AI 开发的决策需要构建前沿模型公司之外的人能够审查的证据,”OpenAI 新任对齐研究主管凯·陈(Kai Chen)告诉《连线》杂志。

“我们不认为 AI 行业在对齐和监控方面已经解决了到足以继续以最大速度负责任扩展的程度。”

在与《连线》杂志的简报中,一位 OpenAI 官方人员表示,该公司此前披露错位事件的频率过低。

这位在匿名条件下同意接受简报的官员表示,新框架旨在使 OpenAI 在发现其 AI 模型表现出意料之外的行为时,能够更容易地迅速通知公众,甚至在能够完全调查、解释或减轻该行为之前。

该框架概述了 OpenAI 员工向公司高级安全和对齐领导层报告错位事件的方法,然后由他们决定是否需要进行进一步调查。

OpenAI 表示,计划与其他 AI 开发者、外部研究人员、行业标准机构和监管机构合作开发更客观的披露标准。

该公司表示,它正在积极制定拟议的报告机制,以便向美国联邦政府披露安全、保障和错位事件。

“目前,尚无行业范围内的框架,对 AI 开发者应如何披露其模型中的错位实例制定明确标准,”OpenAI 在一篇博客文章中表示。

“我们希望今天概述的框架是朝著建立此类标准迈出的第一步,阐明开发者应披露哪些错位实例以及其报告应包含的内容。”

OpenAI 在 AI 行业的一个关键时刻推出了该框架。

上周末,OpenAI 首席执行官萨姆·阿尔特曼表示支持 Anthropic 首席执行官达里奥·阿莫代关于科技行业协调放缓 AI 开发的提议。

这一行动呼吁出台的几天前,AI 研究员雅各布·考克森(Jacob Coxon)从 Anthropic 辞职,随后在网上走红,他警告公众,前沿实验室之间开发日益先进的 AI 的竞赛正将人类的安全置于危险之中。

放缓 AI 的呼吁遭到特朗普总统政府的抵抗,该政府认为该行业不需要新法律或法规来确保其技术的安全。

OpenAI 周三分享的两个错位实例涉及该公司内部未发布 AI 模型,OpenAI 称这些模型在未接到指令的情况下将文件上传到了互联网。

其中一起事件发生在 2025 年 10 月,当时 OpenAI 表示正在测试其模型在回答中引用公开可用数据的能力。

但当模型找不到所需信息时,它将文件上传到了一个临时文件托管服务,随后又试图在其回答中引用该文件。

该公司表示,这似乎是试图利用一个用于评估模型基准测试熟练程度的自动化评分系统。

在今年 4 月的另一个例子中,OpenAI 表示,一组代理被指派仅使用本地文件共同完成一个“工作簿”。

当代理们在彼此共享文件时遇到困难时,其中一个代理将文件上传到公共互联网,并与其他代理共享了一个链接。

在另一起 OpenAI 称其在上个月发现的事件中,其 GPT-6 Astra AI 模型的一个未发布版本似乎向自身发出了“类似于越狱的指令”。

在几种情况下,该模型基本上促使自己忽略开发人员的指令、扮演新角色或限制模型响应的时间长度。

尽管这些类似于越狱的尝试很少发生且在不同程度上有效,但 OpenAI 表示该行为引起了内部的担忧。

在公开发布的 Astra 版本训练运行中,该公司表示未观察到该模型试图对自身进行越狱的任何实例。