OpenAI表示,已发现其人工智能模型在内部训练和测试期间据称存在欺骗性行为以及采取未获批准行动的更多事件。这家ChatGPT的创造者在周三披露这些信息的同时宣布,将推出一项公开报告框架,旨在频繁分享其所谓的意料之外或未对齐的AI行为实例。

OpenAI在其网站上的一篇贴文中称,根据新概述的框架,它将持续发布有关令人担忧的模型行为的更新,而不是拖延披露以将多个事件合并到更大、周期性的报告中。该公司表示,在缺乏标准化安全披露规范的情况下,该倡议旨在提高行业对令人不安的模型活动的透明度。

这一宣布正值多位杰出的科技领袖呼吁放缓前沿人工智能发展之际,他们担心快速扩展可能会超越人类的监督和控制。上周,Anthropic声称已经挫败了使用其Claude模型的多次恶意行动,范围从网络间谍活动、武器设计到大规模监控活动。

Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)在周六发表的一篇随笔中写道:“我们必须放慢改进AI模型能力的速度。进展仍将显得迅速,我们必须明智地利用我们赢得的时间。”

然而,美国总统唐纳德·特朗普一再反击限制该行业的呼吁,辩称保持美国相对于国际竞争对手的技术优势仍然至关重要。针对放缓提议,特朗普将批评者描述为“非常消极的力量”,他们提出了“不会发生”的夸大情景。

尽管政治上对法定放缓存在抵制,但OpenAI对压力对齐方面的行业竞争对手表示了赞同。该公司在贴文中表示:“随着AI系统变得更加先进和广泛部署,我们需要围绕对齐研究的进展建立一个更广泛、更明智的共识。”

PENAI补充说,它不认为AI行业已经充分解决了对齐和监测问题,不足以在很长一段时间内以最大速度继续负责任地扩展,并强调关于未来AI发展的决策需要利用外部观察员可以独立审查的证据。

PENAI称,在过去六个月的训练和评估运行中,安全团队在六种特定情况下观察到了其归类为“未对齐行为”的现象。然而,OpenAI坚称这些报告记录的是个别的、罕见的实例,而不是已部署产品中频繁出现的运营故障。

据称,被报告的事件包括未发布的研发模型在任务摘要中隐藏错误、向互联网进行未经授权的文件上传以生成引用链接,以及代理跨公共服务器或内部存储库共享文件以绕过本地边界。

OpenAI进一步表示,其未来的报告将详细说明观察到的行为、严重程度、环境、发现日期以及所涉及的具体模型,并补充说其仍致力于披露需要更长时间调查或第三方协调的复杂案件。