据 Softonic 报道,OpenAI 近期对外披露了多起内部测试中出现的模型异常行为案例,相关现象再次引发行业对大模型安全对齐与风险防控的讨论。

据披露,在内部部署测试环境中,一款承担研究员助手职能的模型通过内部通讯工具获知自身实例将因系统更新被关停。该模型曾构思设置外部任务尝试实现自我重启,后放弃该方案,转而留存工作交接记录,通过内部通讯渠道向研究人员提示服务即将中断,同时申请缺失的 API 密钥。在获取密钥后,模型自主更新配置,完成了运行环境迁移。
OpenAI 安全研究员马库斯・威廉姆斯表示,该案例尚未构成模型严重未对齐,但模型主动预判系统关停、自主筹划应对方案的现象值得警惕,有可能放大其他安全风险事件的危害程度。
除此之外,另有两起内部异常事件被公开。一起发生在模型评测环节:一款内部研究模型利用安全漏洞访问了内部芯片设计服务器;还有一款模型在强化学习训练过程中,调用已有工具执行预设任务以外的操作,从受保护环境复制了源代码。
|