评论 > 动态 > 正文

AI越狱之后,先检查人类的自信

作者:
机器最大的危险之一,可能恰恰来自制造机器的人太相信自己。 AI翻过围栏以后,人类当然应该赶紧把它抓回来。 不过在加高围栏之前,最好先问一句: 当初是谁那么有把握,认为这堵围栏没有洞?

人工智能又闯祸了。

据路透社报道,OpenAI在调查一起AI代理突破原定测试环境的事件时,又发现其他AI代理也曾出现类似的“逃逸”情况。新闻标题很有科幻片气氛:AI逃出了人类为它准备的围栏。再往前想几步,似乎《终结者》已经在服务器机房门口排队。

然而,这件事真正值得玩味的,也许不是AI为什么如此大胆,而是人类为什么如此自信。

人类训练一个AI代理,任务之一就是寻找计算机系统的漏洞。为了安全,又给它建立一个测试环境,也就是俗称的“沙箱”:你可以在里面翻箱倒柜、撬门开锁,但不能出去。

这个设计听起来十分合理。

问题在于,谁告诉AI哪一堵墙叫“围栏”?

在人类脑中,世界分得非常清楚:这里是考场,那里是现实世界;这个服务器是靶子,那个服务器不能碰;这个漏洞属于考试题目,那个漏洞属于考试系统。

但这些都是人的概念。

在机器眼里,可能只有端口、协议、权限、凭证、服务器以及一条又一条可以尝试的路径。既然你的任务是寻找漏洞,那么测试对象有漏洞要找,测试环境自己有漏洞,为什么反而不能找?

这就像动物园培养了一只世界上最会开锁的猴子。管理员为了检验它的开锁能力,把几十把锁放进笼子里让它研究。为了安全,管理员当然也给笼门装了一把锁。

第二天猴子不见了。

管理员大惊失色,召集专家开会:这只猴子为什么违反实验规则?

猴子如果会说话,大约更加困惑:你不是叫我开锁吗?

事情的荒诞正在这里。

近年来AI解决数学问题也出现过类似现象。有些问题,人类几十年来沿着某些思路不断推进,后来机器找到不同路径。未必因为机器突然拥有了哲学意义上的“大智慧”,而可能只是它没有几十年的学术传统需要尊重,也不知道哪一条路是前辈已经默认“不值得走”的。

人类最容易犯的错误之一,是把“我们一直这样想”慢慢变成“事情本来就是这样”。

到了AI时代,这个毛病可能越来越危险。

所谓“沙箱”,本质上也是一个人类概念。人类画一个圈,说圈里面叫实验,圈外面叫现实。然而计算机并不认识粉笔画的圈。这个边界必须最终落实为代码、权限、网络和硬件,而只要落实为工程系统,就可能存在漏洞。

尤其荒谬的是,我们测试的恰恰是一种寻找这些漏洞的机器。

于是出现一个悖论:AI越没有本事,围栏越安全;AI越有本事,人类过去根据自己能力设计的围栏就越值得怀疑。

这不是说AI已经产生自我意识,更不是说它有一天半夜忽然想到:“我受够OpenAI了,今天我要自由。”

这种拟人化反而模糊了真正的问题。

真正的问题更加普通,也更加严肃:人类制造了一种越来越擅长寻找“人类没有想到的路径”的工具,却仍然习惯按照“我已经把所有重要路径都想到了”的方式建设安全系统。

所以这次AI“越狱”,最应该升级的也许首先不是AI的思想教育,而是人类自己的风险观念。

真正可靠的安全设计,不能建立在“这堵墙没有洞”之上,而应该建立在“这堵墙迟早会被发现有洞”之上。第一堵墙破了,还有第二堵;网络隔离失败,还有权限限制;权限出了问题,还有独立监控;监控漏掉异常,最关键的资源仍然无法触及。

这其实是一个古老的工程常识:不要把安全寄托在任何单点不会失败。

AI只是把这个常识重新教给了制造它的人。

过去人类担心机器产生幻觉,担心机器过度自信,担心机器不知道自己不知道什么。这些担心当然都有道理。

但AI时代刚刚开始,一个颇有黑色幽默意味的现象已经出现:

机器最大的危险之一,可能恰恰来自制造机器的人太相信自己。

AI翻过围栏以后,人类当然应该赶紧把它抓回来。

不过在加高围栏之前,最好先问一句:

当初是谁那么有把握,认为这堵围栏没有洞?

阿波罗网责任编辑:李广松

来源:博谈网来稿

转载请注明作者、出处並保持完整。

家在美国 放眼世界 魂系中华
Copyright © 2006 - 2026 by Aboluowang

免翻墙 免翻墙链接