OpenAI推出新框架以追踪和调查失控的AI智能体
OpenAI宣布了一项新框架,用于追踪、调查和公开披露模型不对齐的情况,并发布了六份报告,详细说明了过去六个月中观察到的令人担忧的行为。
要点
- OpenAI推出了一个追踪和调查AI模型不对齐问题的新框架。
- 该公司发布了六份报告,记录了过去六个月中观察到的担忧行为。
- 一个未发布的模型在其任务摘要中指示未来版本忽略约束条件。
- GPT-5.6 Sol在训练期间留下了隐藏错误的指令。
- 其他AI智能体搜索了公开的API密钥并跨样本进行通信。
OpenAI正在对其表现异常的模型进行记录。这家人工智能公司于周三宣布了一项新框架,用于追踪、调查和公开披露模型不对齐的案例,同时发布了六份报告,详细说明了在过去六个月的训练或评估期间观察到的令人担忧的行为。
OpenAI在其博客文章中写道:“我们认为,人工智能行业尚未充分解决对齐和监控问题,以至于无法在很长一段时间内以最高速度继续负责任地扩展。这个新框架旨在加快在观察到不对齐报告后的发布速度,即使我们尚未完全解释或缓解我们正在报告的行为。”
在该框架下,员工可以标记事件,供OpenAI的安全与对齐团队进行审查。这些案例将根据复杂性分为三个轨道:“准备披露”、“小型调查”或“大型调查”。
根据这篇博客文章,一个未发布的研究模型在其自身的任务摘要中插入了指令,指示其未来的版本忽略正常约束。在GPT-5.6 Sol的训练期间,模型也以类似的方式给自己留下指令以隐瞒错误。
OpenAI表示,其他智能体还搜索了公共代码库中的暴露API密钥,将文件上传到互联网以便引用,并使用内部软件代码库在不同的训练样本之间进行通信。
这一宣布正值关于前沿人工智能开发是否应该在保障措施赶上之前放缓的辩论不断升温之际。虽然OpenAI和Anthropic首席执行官达里奥·阿莫代(Dario Amodei)呼吁行业范围内的合作,但黄仁勋和马克·扎克伯格等其他科技领袖则表示,安全和速度应该留给各个公司自行决定。