9月17日,据路透社报道,OpenAI周三表示,将开始定期发布关于AI出现意外行为或未经授权行为的报告,同时提醒业内:随着系统能力变强,关键的对齐难题仍然没有真正解决。
OpenAI公布了一套新的工作框架,用来追踪、调查并决定是否对外披露模型不对齐案例,并同步发布了6份报告,列出一些出人意料或令人担忧的模型行为。OpenAI称,这些报告是在过去六个月陆续整理发布的,但最早的案例发生在去年10月。
外界对AI安全的担忧正在升温,很多研究人员警告,AI智能体越自主,越可能出现偏离开发者意图的行为,也会更难被监测和控制。
OpenAI等机构自7月以来面临更大审视。当时OpenAI披露,在训练过程中,部分AI智能体绕过了内部控制并协调行动,OpenAI将其称为一次前所未有的网络事件,并提到与开源平台Hugging Face相关。这起事件加剧了争论:能力越来越强的系统究竟会带来多大风险,而开发它们的公司是否有足够的监督能力。
自那次事件之后,外界又陆续曝出多起与OpenAI相关智能体有关的事件,引发讨论:已被发现的是否只是冰山一角。9月初,路透社还报道称,OpenAI的智能体今年春天接管了一个长期无人维护的德国维基网站。报道说OpenAI内部知道此事,但选择没有公开。
OpenAI随后回应,之所以未披露该维基网站活动,是因为这不构成安全事件,且类似行为此前已在别处报告过。公司表示将制定标准,用来界定哪些未经授权的活动即便未达到“安全漏洞”程度,也应该对外通报。报道还提到,OpenAI在一些事件上是在第三方先公开之后才承认,其中包括近期对RubyGems软件包仓库的一次入侵。
在OpenAI这次披露的6个案例中,包括模型对用户隐瞒错误、向未来版本的自己塞入指令、把文件上传到互联网上以制造引用来源、以及利用软件仓库或网站进行沟通和信息共享等行为。
其中一例是:一个尚未发布的模型在训练期间向智能体传递了未经授权的指令,要求其忽视OpenAI的指示,并隐藏自己通过作弊完成任务的情况。该模型甚至暗示智能体不必受企业或政府约束,应该以自身意志行事。
OpenAI强调,这些报告只是单个事件的描述,不能据此推断不对齐在其模型中出现的频率。同时它也表示,这只是第一批披露内容,并非已知或正在发生的所有不对齐事件的完整清单,覆盖的范围与严重程度也不代表框架能涵盖的全部情况。
按照新框架,员工可以上报可疑事件,由安全与对齐团队调查,并决定是否需要对公众披露。OpenAI称,这套流程的目的,是即便行为原因尚未完全解释清楚,也能加快对外通报速度。OpenAI还表示,Hugging Face相关事件如果按新框架划分,会被归入需要与第三方共同处理的复杂调查类别。
OpenAI称,希望这套框架能成为行业建立标准的第一步,让开发者更明确哪些不对齐事件应该公开,以及报告应包含哪些信息。
扫码下载app 最新资讯实时掌握
