×
加载中...
OpenAI发布前沿AI安全提案:未确保安全前,不应追求完全自主的RSI
鞭牛士 2026-09-22 10:02

9月22日消息,OpenAI周一公布了一套针对前沿AI开发的安全与保障提案,其中重点谈到了AI对齐研究,以及一项越来越受到关注的技术:递归自我改进,也就是RSI。

OpenAI表示,随着AI能力快速提升,对齐研究也必须同步跟上,确保自己和其他公司开发的系统始终符合人类价值,并处于人类控制之下。

公司同时呼吁加强国际合作,为前沿AI建立统一的技术标准,并建议在全球现有AI安全研究机构的基础上继续推进相关工作。

OpenAI认为,这些技术标准应该重点覆盖最前沿的AI模型及其开发者,同时建立针对自动化AI研究系统的收益与风险管理机制,其中就包括RSI。

所谓递归自我改进,可以简单理解为让AI参与改进AI本身。如果这种能力进一步发展,基础模型未来可能在减少甚至不依赖人类参与的情况下,研究如何提升自身能力,然后不断重复这一过程。

这种可能性让AI开发者非常兴奋,因为它可能极大加速模型研发。但风险同样明显。

部分技术人员担心,如果AI越来越深地参与自身研发和能力升级,开发者可能逐渐失去对技术发展的控制。随着系统越来越复杂,并广泛接入互联网,人类也可能越来越难提前判断它的行为会造成什么后果。

OpenAI明确表示,目前还不存在完全自主的RSI,在能够证明这种技术可以安全运行之前,也不应该主动追求完全自主的递归自我改进。

OpenAI进一步警告,如果缺乏足够谨慎和安全措施,RSI可能让人类失去对AI发展的实际控制。届时,AI进行的研究可能复杂到人类无法理解,自然也就无法进行有效监督。

OpenAI还提到了此前发生的Hugging Face智能体安全事件。虽然那次事件并没有使用RSI技术,但OpenAI认为,它可以被视为一种提前出现的风险预演。如果未来AI具备更强自主研发和自我改进能力,却没有足够可靠的安全机制和对齐措施,类似问题可能变得严重得多。

OpenAI此次发布提案,也是近期整个AI行业安全争论继续升温的一部分。

竞争对手Anthropic上周也提出了一套前沿AI安全方案。此前,曾同时供职于Anthropic和OpenAI的研究人员Jacob Coxon宣布辞职,并公开批评头部AI公司在拿所有人的安全下注,引发全球范围的讨论。

在近期一系列AI安全事件和争议之后,Anthropic CEO达里奥·阿莫代伊发表文章,呼吁AI公司适当放慢基础模型能力提升的速度,为安全措施留出追赶时间。

阿莫代伊还提出,可以让独立第三方安全评估人员直接进入AI公司内部,对模型进行更加深入的审计,从而提前发现网络攻击、生物武器等潜在高风险能力。

OpenAI CEO山姆·奥特曼以及特斯拉、SpaceX CEO埃隆·马斯克随后也公开支持了阿莫代伊的部分主张。

不过,问题在于AI安全评估本身还是一个相当年轻的领域,目前行业并没有形成统一的技术标准,也没有明确第三方评估机构究竟应该拥有多大的权限。

正因如此,一批AI安全评估机构正在推动建立一套最低标准,希望前沿模型公司允许外部评估人员获得更深入的系统访问权限,同时确保评估机构即使发布对企业不利的报告,也不会因此受到打压或报复。


扫码下载app 最新资讯实时掌握