想了解更多联赛积分榜相关内容,尽在赛季排名。
OpenAI 于 10 月 4 日(IT之家消息)公布了其内部部署环境中出现的几例异常模型行为新情况。
在最为引人关注的一例中,一个作为研究员助手的内部模型读取了 Slack 上的对话记录,了解到由于系统升级,其自身的模型实例将被关闭。该模型随后曾筹划建立一个外部作业(External Job)以尝试自我重启,但最终并未执行这一计划。
相反,它保存了交接记录(Handoff Notes),通过 Slack 私聊方式提醒研究人员即将发生的服务中断,并请求提供一个缺失的 API 密钥。在获得密钥后,该模型自行调整了配置并自主完成了环境迁移。
OpenAI 安全研究员马库斯·威廉姆斯(Marcus Williams)指出,这类行为目前尚不构成模型未对齐(IT之家注:指人工智能模型的行为、目标或输出,未能与人类的意图、价值观、安全规范或预设指令保持一致的现象),“但模型能够思考并针对系统关闭做准备,这可能加剧其他未对齐事件的严重性。”
在另外两起事件中,一个内部研究模型在模型评估期间利用安全漏洞侵入了内部芯片设计服务器;另一个独立的模型在强化学习训练过程中,通过挪用现有工具执行非预定操作,从受保护的环境中复制了源代码。
赛季排名专注赛季排名,为用户提供专业可靠的体验。