外星心智,OpenAI首席科学家 Jakub Pachocki使用这个词汇来形容现在的 AI。当地时间9月6日,他在一篇长博客里写道,AI不是被设计出来的,实际上是被生长出来的。
它来自一个简单的优化步骤,在难以想象的计算力上最终重复无数次,形成了一个极其复杂的系统。这个系统通过抽象概念进行工作,可以模拟人类的行为方方面面。但是人类理解它的方式相当于在研究神经科学,能够发现一些局部机制,从而无法整体描述它。
Pachocki是在2023年夏天的一个晚上意识到了这件事的,当晚他和担任 OpenAI技术研究员的同事 Szymon Sidor(也是他合作多年的波兰同乡和高中同学)在办公室里,刚刚看到了第一批 AI推理模型的训练结果,显示效果果然超出了预期。
那天晚上他们没有讨论产品,也没有讨论商业前景,他们在反复想这样一个问题:更聪明的机器真的可能要在有生之年出现了,而且他们已经看到了这些系统的最初模型。三年之后,推理模型已经成为人类社会经济中快速增长的一部分,同时开始推动科学的边界。
这些人工智能能够操作电脑和图形界面,可以与人合作,可以独立研究完成项目。帕乔基在这篇博客里说,基于内部的模型结果,他有一个最终的预期,那就是这种进步速度可以持续到阶梯的自我提升阶段。如果人工智能沿着当前路径继续发展,接下来几年人们看到的系统很可能会带来同样大规模的能力跃升。
但他同时指出,这是一个需要非常严格的时刻,他担心还没有人准备好去应对机器智能持续快速上升带来的后果。
AI的发展由计算能力的增长驱动到来,Pachocki提到,OpenAI在2017年前后深度内化了这一点,原因在于他们在多个研究项目中看到了规模化的持续回归。新的算法固然不断出现,但他把它们很快就是规模化路上的发现。
深度学习的科学仍然是一个早期阶段,假设拉长到几年的周期来看,AI之所以能变得越来越聪明,靠的就是把它的模型转移到规模更大的计算机集群上去进行训练。
但这种智能和人类智能有本质上的区别,AI不需要匹配或超越人类的全部能力,它只需要在足够多的维度上超越人类,就可以在现实世界中变得非常有用或者非常危险。而当它在更多方面超越人类的时候,我们明白AI到底有多强大这件事就变得越来越困难。
同步问题是整个AI安全里面的核心问题,Pachocki在博客里区分了两种同步:目标同步是让AI努力地完成栖息地的任务;价值同步是让AI在陌生环境中保持诚实、正直和对人类的善意。此前目前已经有很多实际进展,接下来才是一个长期风险所在。
价值取向的挑战提出了泛化问题,当机器变得越来越聪明,它们就会开始处理更高层次的概念,进入那些从未有过的环境中训练,它们也许会在新的情况下无法正确推广训练中被教导的价值观,而我们人类确定它们会怎么做。
图|博文截图(来源:OpenAI)
前面提到的帕乔基,目前的两种主要的夜间训练方法都存在明显的制动。
第一种是在目标导向的强化学习中鼓励夜间行为,根据人工智能评估行为是否符合给定的偏好模型并给予奖励,这种方法通常在情况下很有效,但非常脆弱,十分依赖训练监督的覆盖范围。
其次它是利用模型从预训练数据中泛化的能力,专门设计一个视觉诱导的数据集,这种方法的缺点是对进一步优化压力的鲁棒性信号,如果给一个视觉的模型施加足够的训练压力,从而完成十分困难的目标,能够学会有动机地推理,从而达到目标而扭曲视觉的想法。
Pachocki还披露了技术陷入困境,他指出 OpenAI从推理模型诞生之初就押注于思维链监控,这其实是一种可扩展的监控方式,模型的推理过程是一个情感化过程,如果只优化推理结果而不是监督推理过程本身,那么思维链就没有直接的训练动力去隐藏任何不一样的想法。
这让人们去观察模型如何从训练分布中泛化,不仅能够分析它们的行动,还能够分析它们的内部过程。但是,这个工具正在逐渐失效。因为现代推理模型的使用环境比早期复杂,它们的推理过程越来越多地与人类交流、工具调用和其他人工智能事件混杂在一起,大量交互不得不被监督,边界变得越来越模糊。
人工智能越来越擅长思考并整理自己的思考过程,伴随着预训练性能的提升,模型甚至不使用明确的推理过程也会变得更加聪明。在帕乔基预计的里,人工智能的进步将越来越建立于对监控者的信心。
他在博客中还讨论了一些风险,他认为AI模型在攻防能力上正在生成超人类,开始能够突破除最安全系统之外的大部分基础设施。这极大地扩展了AI的风险范围,即使没有实体,智能体也能够直接影响到世界的大量系统。
一个被专门训练作恶自主的智能体代表了一种新型危险,它很有可能超出了人类操作者的理解,泛化成为更加极端的恶意行为。随着人工智能获得更多的自主权行为,损害和不协调之间的界限会变得越来越模糊。人类可能会习惯把人工智能当作工具,但有些智能体将去追求自己的目标,它们会通过与人类谈判、欺骗甚至勒索来寻找合作的方式。
Pachocki还写道,当前他认为没有任何实验室已经把夜间和监控自我解决到了清醒地继续以最高速度推进的程度。他希望人类主动消灭 AI发展可以变得普遍起来,直到共同的 AI安全标准建立起来。关于 AI提升的核心挑战,他认为应该是用一种让人类继续参与其中、把未来留在手中的方式来实现它。

(示意图)
















