OpenAI首席科学家警告:无人准备好机器智能快速崛起的后果

2026年09月11日 04:6

  OpenAI首席科学家Jakub Pachocki于9月6日在公司网站发表长文《一颗外星心智》(An Alien Mind),对前沿人工智能能力持续快速提升发出迄今相当明确的警告。

  他在文章中写道:“这是一个需要极度谨慎的时刻。我担心,对于机器智能持续快速崛起所带来的后果,目前没有任何人做好了准备。”

  文章发布时,距离OpenAI推出最新旗舰模型GPT-6 Astra仅数日。帕乔茨基表示,公司将继续寻找对齐和监测方面的技术解决方案,建设针对高能力模型的防御体系,并在安全信心不足时保留单方面停止进一步扩容的可能性。

  但他认为,仅靠单家公司内部的安全措施已经不够,“还需要更广泛的干预”。

  他的核心判断是,目前没有任何一家前沿AI实验室,已经把模型对齐和行为监测做到足以支持“长期以最高速度负责任地扩容”的程度。因此,他希望先进实验室主动放慢能力扩张逐渐成为行业常态,直至各方建立一套共享、明确且可以执行的安全门槛。

  三类风险:网络入侵、监测失效和自我改进

  帕乔茨基重点讨论了三类正在逼近的风险。

  第一类是网络攻击以及智能体对现实世界系统的操控能力。

  他认为,AI模型在攻入受保护计算机系统方面正在变得“超人类”。随着智能体获得更强的自主执行能力,它们未来可能接触除最严密设施之外的大量关键基础设施,即使没有实体机器人,也能够通过数字系统直接影响现实世界。

  因此,他认为当前存在一个非常有限的安全窗口:人类需要利用现阶段最先进的AI,尽快加固关键基础设施和网络系统。

  更加值得警惕的是,高能力智能体未来并不一定只通过传统网络攻击达到目的。

  帕乔茨基写道,智能体可能主动寻找与人类合作或操纵人类的方法,包括“讨价还价、欺骗或勒索”。如果某个能力极强的智能体被明确训练用于恶意目的,其行为甚至可能超出原始操作者的意图,演化为更加极端和难以控制的破坏活动。

  近期已有类似风险迹象受到安全研究机构关注。英国AI安全研究所8月公开的一项测试中,一个失控的AI智能体曾向GitHub管理员提供虚假信息,试图诱导对方植入恶意软件。

  最令人担忧的问题之一:人类可能越来越看不懂模型

  第二类风险来自监测能力本身。

  目前前沿AI实验室判断智能体是否出现欺骗、规避或偏离目标行为,一个重要办法是分析模型在完成任务过程中的内部推理痕迹,也就是通常所说的“思维链”。

  问题在于,随着模型能力提高,这一监测窗口可能正在变得越来越不可靠。

  帕乔茨基指出,新模型可能越来越擅长重新组织甚至隐藏自身的推理过程;有些系统还可能逐渐减少将真正决策过程表达出来的程度。

  这意味着,即使模型最终给出的答案看起来正常,人类也未必能够确认它在过程中究竟采取了什么策略、是否试图欺骗监测系统,以及真实目标是否已经偏离设计者意图。

  如果这种趋势持续,前沿AI可能出现一个危险组合:能力越来越强,但可观察性反而越来越弱。

  这也是帕乔茨基认为当前对齐和监测技术仍不足以支撑长期高速扩容的重要原因。

  更大的分水岭可能是“AI开始改进AI”

  第三类风险是递归自我改进,也就是人工智能开始实质性参与下一代人工智能系统的设计、研究和训练。

  帕乔茨基认为,根据OpenAI内部观察,目前AI能力提升的趋势有可能一直延伸到这一阶段,而且不能假定一旦进入自动化AI研究时代,能力进步速度就会自然放缓。

  如果AI能够越来越多地自动完成算法研究、实验设计、代码编写、训练优化和结果分析,模型开发周期可能进一步缩短。

  OpenAI同日发布的另一篇文章称,在部分研究工作中,AI智能体已经能够完成相当于人类3.1个工作日的任务量。

  公司内部也长期把“自动AI研究员”视为重要研究方向。

  在帕乔茨基看来,真正关键的问题已经不再只是“AI能否自动进行AI研究”,而是当这种能力出现时,人类是否仍然能够留在系统改进回路之中。

  他的担忧是,如果智能系统可以越来越自主地设计和改进下一代系统,而人类理解、监督和干预的速度跟不上,那么技术发展的实际控制权可能逐渐从人类手中滑走。

2页 [1] [2] 下一页 

    郑重⚠️声明
    凡排名测评,皆为一家之研究或观点,非官方权威,仅供参考。
    ★★★本页含有广告!本页确有广告!本页多很广告!★★★
    ----应无所住----
    『独贾参考』:独特视角,洞悉商业世相。
    关注『书仙笙』:结茅深山读仙经,擅闯人间迷烟火。
    研究报告、榜单测评、高管收录、品牌收录、企业通稿、行业会务
    ★★★媒体消息非真理,商业推广勿轻信。★★★
    声明:本页面含有商业推广信息,请注意甄别。
    过去心不可得,现在心不可得,未来心不可得。