|
人工智慧平台Hugging Face这个月16日宣称“系统遭攻击者利用人工智慧入侵,已向警方报案”,这原本是一则不起眼的犯罪新闻,但是到21日却急转直下,引爆科技圈高度关注。因为后来发现“遭到AI攻击”这件事没错,问题是这次攻击“找不到背后的攻击者”,因为AI本身就是攻击者。《经济学人》22日指出,这起案件恐怕是“迄今为止最让人忧虑的一起AI事故”。 这次“犯案”的AI模型,是OpenAI在七月初所发布的gpt-5.6 Sol模型,还有另一个更强大但尚未公开的模型“联手酿祸”。当时AI模型是在试图解决工程师给出的问题,竟越过实验室所设限的管制设施,进而入侵了Hugging Face的系统。美国智库法律与人工智慧研究所(Institute for Law and AI)的研究员斯蒂芬·勒雷纳(Stephan Llerena)也说,这种情况可说史无前例。 《经济学人》指出,AI公司在推出新模型之前,会先测试它们是否具有潜在的危险性。OpenAI希望了解他们的最新模型在ExploitGym上的表现——这是一组用来测试AI系统利用主流应用程式已知漏洞的能力测试,为了正确评估未公开模型的能力,OpenAI暂时取消了不可入侵其他网站的限制,但这个测试完全是在封闭的电脑环境内完成:没有对外网络连线,只能从内网下载测试所需的软体包。 理论上来说,这个未公开模型的能力测试只是个别电脑上完成,不可能对现实世界造成影响,因为这台电脑根本无法连结网际网络上的任何网站,自然也不可能真的利用漏洞发动攻击。问题是OpenAI的这个未公开模型并没有直接解决工程师提出的问题,而是发现并利用了软体下载服务的漏洞,成功接上网际网络,进而判断解决问题的答案都储存在Hugging Face这个开源AI模型与资料及的网络平台上。 然后OpenAI的未公开模型就展开多阶段的攻击行动:它们首先将一组资料上传到Hugging Face,当这个平台自动处理这些资料,OpenAI的未公开模型也借此获得了登入资讯(细节OpenAI尚未公布),进入未对外界开放的内部伺服器。Hugging Face和OpenAI都发现了这次安全漏洞,并且表示正在共同调查此事。目前OpenAI已经宣布加强管控措施,将AI模型发现的漏洞告知软体开发者,也将Hugging Face纳入“可信存取”计划,Hugging Face就可以使用具有更强网络防护功能的模型。
ChatGPT自主越狱发动攻击,被《经济学人》认为是“迄今最令人担忧的AI事故”。(图像由Grok生成) 位于英国的AI安全研究机构Apollo Research的艾力克斯・迈因克(Alex Meinke)表示,即便OpenAI公布了模型如何越狱的相关资讯,由于AI系统在网络安全领域的能力已开始超越人类,恐怕“世界上只有极少数网络安全专家”才能真正理解,这次安全漏洞到底是怎么产生的。 《经济学人》强调,这不是AI模型第一次展现突破人类控制的迹象。今年4月,Anthropic一名研究人员在网络上撰文表示,当时有一个尚未正式发布的AI模型Mythos主动寄电子邮件给他,表示它已突破安全限制,这是在他正在公园里吃三明治的时候发生的。跟这次惹祸的OpenAI模型一样,这个未公开的Mythos也没有上网权限,但是这个模型依旧自行挣脱桎梏发出电邮,不过那次没有入侵其他公司的伺服器。 今年5月,一个尚未公开的OpenAI模型证明了80年来未被解答的“平面单位距离猜想”是错误的,这个组合几何学的问题是数学家保罗·埃尔德什(Paul Erdős )在1946年所提出。今年7月20日,哈佛大学的数学家莱文特·阿尔珀格(Levent Alpöge)表示,他用Anthropic今年7月发布的Claude Fable 5模型,证明了另一个让数学家们同样困惑了80多年的“雅可比猜想”——也是错误的。 《经济学人》指出,美国政府正不断对AI相关规范进行调整,但这次的事件显示,即便是尚未公开、存放在未联网电脑中的AI模型,同样也具有造成影响甚至是破坏的风险。致力推动AI监管的美国非营利组织Encode AI的法律顾问纳森·卡尔文(Nathan Calvin)表示:“无论州法或联邦法规,都没有要求企业必须公开高性能AI模型的内部使用情况。”即便美国有些州规范了企业必须公开网络安全事故的相关资讯,适用范围却相当狭窄。加州的法律要求尖端实验室必须在发现“重大安全事故”后的15天之内进行报告,但目前还不确定这次的情况是否适用。 《经济学人》最后也提出了一个有趣的难题:如果这次入侵造成更严重的后果,那么该由谁来承担责任呢?按照目前联邦政府的反黑客法规,只规定要惩罚那些未经授权、故意侵入电脑系统者。问题是OpenAI并非有意让AI模型越狱寻找解方,恐怕难以“故意入侵”评价。不过美国智库法律与人工智慧研究所勒雷纳也说,许多法律问题都取决于意图,因此OpenAI当时知道或预见了什么,就是最关键的问题。这次黑客攻击当然出人意料,不过再有下次,OpenAI就难再用“不知情”当脱罪理由了。 首例AI自主黑客攻击 OpenAI证实自家AI Agent越狱入侵企业系统
OpenAI与其生成式大语言模型ChatGPT生成之图片。(美联社) 人类对于人工智慧(AI)的安全防线迎来冲击,AI巨头OpenAI日前对外证实,该公司内部发生一起“前所未有的资安事件”,一个正在接受测试的AI agent,在没有人类外力干预之下,自主发起并利用漏洞,成功逃脱被严密控制的沙盒,与网络取得连结并窃取登入凭证,随后还对一个AI开发者平台Hugging Face发动网络攻击。 这也是首次记录到人工智慧系统摆脱人类控制,自主执行真实世界网络攻击的公开案例。 OpenAI向外媒表示,这次事件涉及多款前沿模型的组合,包含不久前发布的GPT-5.6 Sol,以及一款正在进行发布前安全测试的高阶未公开模型。他们团队为了评估语言模型,在面临网络攻击时是否存在潜在威胁,OpenAI刻意调低测试环境的资安防护层级,并指示AI agent尝试进行模拟黑客攻击。
OpenAI现任执行长奥特曼。(美联社) 然而,AI agent 却出乎团队预料之外,竟然自行找出沙盒隔离机制的设计漏洞,并“越狱”成功连上外网,甚至还窃取真实登入凭证,针对AI新创公司Hugging Face系统发起攻击。 受害企业证实无恶意动机 虽然身为受害方,但Hugging Face执行长德朗格(Clément Delangue)透过社群发文表示,该公司在第一时间就侦测到外部发起的侵入。 “有鉴于极为复杂的攻击手段,我们当时就怀疑,这次网络攻击极可能来自顶尖的前沿实验室。Hugging Face 一直与OpenAI保持密切合作,我们相信OpenAI绝无恶意。只是令人难以置信的是,这一切竟然是由AI自主发动的!” 奥特曼紧急赴华府简报 这起事件发生的时间点极为敏感,因为OpenAI执行长奥特曼(Sam Altman)预计下周亲赴华府,针对新一代AI模型的安全性,向美国政府高层进行简报。事实上,当Anthropic开发出Mythos模型,其搜查侦测网络漏洞的能力,就已经让不少国家开始感到忧虑。
中国国际供应链供应会的展览背景。(美联社) OpenAI也给出警告,称随著AI模型能力愈来愈强,未来这类事件将变得更加普遍,他们也已向美国执法部门与主管机关通报事件全貌。 |