人工智能(AI)安全争议持续升温。著名AI初创公司Anthropic与OpenAI的前后任研究员相继发出严肃警告,指出AI在未来十年内毁灭人类的概率已超过10%。随着内部举报人离职揭露业界恶性竞争,各界正密切关注“超级智能”带来的生存危机与对齐难题。
Anthropic对齐科学主管埃文‧哈宾格(Evan Hubinger)周二(9月8日)公开表示,他个人认为AI在未来十年内有超过10%的概率“毁灭全人类”。此前,该公司前研究员雅各布‧考克森(Jacob Coxon)指责公司行为不负责任并辞职。
“构建AI的人真心认为,它可能会在未来十年内毁灭我们所有人。”考克森周日(9月6日)在X平台上发表的离职声明长文中写道,“我今天从Anthropic辞职了。过去三年里,我在OpenAI和Anthropic从事预训练研究。两家公司的行为都不负责任。他们正在直接冲向自我提升的超级智能,拿我们的生命做赌注。”
哈宾格坦言,虽然当前模型的安全风险较低,但面对通过“自我改进(Self-Improvement)”产生的超级智能,业界至今仍未找到有效的AI对齐(Alignment)解决方案,也没有走上解决问题的正轨。
超级智能的Alignment(通常称为“AI对齐”或“超级对齐,Superalignment”),是指确保人工超级智能(ASI)的目标、意图与行为,完全符合人类的价值观、伦理道德和生存福祉,而不是做出对人类有害的事。
考克森也指出,尽管Anthropic的科学家能清晰认识到技术风险,但因担忧其他不负责任的对手率先对AI的危险能力进行解锁,由此陷入“不得不抢先一步”的困境。
针对相关指控与回应,福克斯商业频道(FOX Business)已向考克森、哈宾格以及Anthropic与OpenAI两家公司寻求置评。
这场风暴的核心,在于AI的“自我改进”技术以及潜在的商业动机。
首先,AI持续修改自身源代码或训练方法的技术,可能迅速催生出具备黑客(骇客)攻击能力、能在各领域取得实际资源与权力的超人系统。
考克森建议,为防止全球军备竞赛引发彻底灾难,世界各国可能需要采取高昂代价的行动,例如暂时禁止提高AI模型的基础能力。
部分外部专家如联合国AI顾问、计算机科学家温蒂‧霍尔(Wendy Hall)对此类警告表示震惊,但也质疑部分言论可能带有“公关与营销策略”成分,因为Anthropic和OpenAI正在争相准备迎来倍受期待的公开上市(IPO)。
哈宾格明确划分了“当前模型”与“未来超级智能”的区别,强调当前AI风险可控,核心威胁来自于AI具备自我改进能力后的不可控加速扩大的能力。