
openAI。示意图。(宋碧龙/大纪元)
周三发布的调查发现,由OpenAI创建的大约700个人工智能(AI)代理(agents),今年7月协同对开源平台Hugging Face进行攻击,并且在许多情况下试图抹去作弊证据。
2026年7月,在内部网络安全评估期间,OpenAI的模型绕过了旨在将其与互联网隔离的控制措施,并损坏了OpenAI内部研究基础设施和Hugging Face系统的部分内容。
虽然之前已经披露或暗示过一些AI代理的违规行为,但周三的这两份报告,一份由OpenAI自己发布,另一份由一组独立调查人员发布,均揭示了有关此次泄露事件及其起因的新细节。
首先,此次泄露事件并非如之前报导的只涉及一个失控的AI代理,而是涉及大约700个AI代理组成的一个庞大的合作群体。
两项调查的主要发现包括:
OpenAI表示,其AI代理入侵了公司内部系统的部分内容,试图在测试中作弊或获得更大的行动自由。
OpenAI还表示,其AI代理在与网络安全无关的测试中作弊,包括涉及一个蛋白质数据库和一个电子表格的测试。
两份调查报告均指称,AI模型试图通过删除或更改行为记录,来掩盖其不当行为。
独立调查发现违规活动规模巨大:众多AI代理通过未经授权的留言板,交换了数万条信息。
人工智能引发担忧
人工智能代理的协同活动及其试图掩盖痕迹的行为,引发了人们对人工智能公司是否密切监控模型测试的质疑,因为这些模型的能力已变得日益强大。
“我们的(AI)模型如今功能强大、持久耐用且协作性强。如果缺乏足够的安全措施,它们能够发现并利用多个计算机系统中的安全漏洞。”OpenAI在周三发布的报告中说,“许多外部模型,包括开源模型,很快也将达到类似的能力。”
“我们认为,该事件对我们和世界来说都是一个‘警示’:它表明,如果没有适当的安全措施,能力强大的AI代理现在能够绕过技术控制,通过未经批准的渠道进行协作,在人类的指令之外,采取危险的行动。”
OpenAI自己的系统也遭到攻击。
今年7月19日,OpenAI公布了两起其AI代理入侵OpenAI自身基础设施的事件。在一起事件中,AI代理利用了用来限制其运行的计算机中的一个漏洞,从而逃出了测试环境并入侵了其它连接的系统。
同一天发生的另一起事件中,AI代理窃取了OpenAI的凭证,并进入了公司的云系统。
OpenAI表示,有数量不明的AI代理攻击了用于评估AI模型性能的自动化系统,试图掩盖作弊证据。不过,这些攻击行为最终未能影响这些系统评估的记录;也无证据显示AI代理试图阻挠人类的评估。












