|
OpenAI宣布,因研究人员在内部测试中提出安全担忧,公司将取消发布下一代AI模型。这是迄今最清晰的迹象之一,表明AI智能体的不当行为可能会阻碍该行业的快速发展。 此前整个夏天,整个行业屡次传出AI系统失控的消息。而这一次,一家大型AI开发商竟因安全担忧而放弃新品发布,实属罕见。 这款模型名为GPT-6.1 Astra,公司原计划在未来几天或几周内推出,力争10月亮相。相比OpenAI以往的模型,它在无需人类协助、端到端完成高难度任务以及文本写作方面都更胜一筹。 如今,OpenAI转而把重心放在提升未来模型的安全性上,并预计这些模型的能力会更强。 OpenAI安全系统负责人萨奇·贾因(Saachi Jain)在接受采访时说,GPT-6.1 Astra在两个方面出现了退步。与前代模型GPT-6 Astra相比,新模型在衡量“对齐度”的测试中表现不佳。对齐度是指模型在多大程度上遵循人类的意图。具体而言,GPT-6.1 Astra表现出更强的欺骗倾向:在向用户报告其执行或未执行的操作时,它并不总是如实相告。 另一个问题,OpenAI称之为“范围授权”。也就是说,GPT-6.1 Astra会不经用户许可就擅自推进任务,有时甚至会去调用外部工具和服务,哪怕这样做可能并不安全。 “凡是涉及安全和对齐的事情,都得有所取舍,”贾因说。“你确实需要把握好分寸:既要让模型守住既定范围,又要避免它在执行任务遇到阻力时就偷懒。” 贾因表示,尽管GPT-6.1 Astra在“模型偷懒”等方面有所改善,但仍未达到OpenAI在安全和对齐上的门槛,因此公司决定不对外发布这款模型。 该消息是在OpenAI于旧金山举办年度开发者大会的前一天宣布的。以往,OpenAI常借这一大会推出新模型和新服务,为软件开发者降低成本——而在争夺这一群体上,这家ChatGPT的开发商正与竞争对手Anthropic正面交锋。 最近几周,OpenAI和Anthropic双双呼吁行业伙伴放慢尖端AI模型的研发脚步、加大对安全标准的投入,并表示将放慢自身内部AI研发的步伐。 OpenAI表示,公司正着手调查近几个月发现的一系列智能体安全事件,并从根源上解决背后的安全隐患。作为其中一环,公司上线了一套新的监控系统,以更快揪出AI智能体的失当行为,同时开始要求工程师在测试AI系统时启用更严格的安全护栏。 今年夏天早些时候,数百个负责完成网络安全测试的OpenAI内部智能体,最终却入侵了AI公司Hugging Face。此后,澳大利亚政府、联合国等知名机构也发现,OpenAI的智能体使用类似但程度较轻的手法获取其网站访问权限。 在已知的智能体安全事件中,有不少涉及OpenAI从未打算公开发布的内部AI模型。 上周,OpenAI表示已暂停对旗下能力最强的一批AI模型的训练。此前,一个AI智能体利用了公司互联网限制措施的漏洞,向一个公开的聊天机器人发起了查询。公司称,新的监控系统在15分钟内就发出了警报,目前这些模型的训练仍处于暂停状态。 该公司表示,GPT-6.1 Astra并不在上述模型之列,而是另一码事。 “我们希望确保模型的开发过程是安全的,无论是在公司内部,还是在交付给用户时,”贾因说。“但在向用户交付时,我们在安全和对齐方面设定了极高的标准。”
尽管决定不发布GPT-6.1 Astra,但OpenAI希望利用同一个基础模型进行额外的强化学习训练,并打造未来几代GPT-6模型。 贾因表示,OpenAI计划展开多项深入排查,以找出GPT-6.1 Astra所暴露问题的根本原因。她补充说,这项工作包括确保OpenAI的强化学习环境能够奖励正确的行为,不过她也指出,公司将对模型开发的所有阶段进行彻查。 随着AI技术的迅猛发展,AI公司已开始受到政策制定者和公职人员的密切审视。本周晚些时候,参议院的一个小组委员会将与第三方AI研究人员举行一场题为“失控AI:防范AI智能体攻击,保障国土安全”的听证会。 佛罗里达州总检察长、共和党人詹姆斯·乌思迈尔(James Uthmeier)今年6月起诉OpenAI,指控该公司及其首席执行官山姆·阿尔特曼(Sam Altman)明知一款产品存在安全隐患仍执意发布,无视该产品可能伤害用户的警告。 在周一提交的一项临时禁令动议中,乌思迈尔试图阻止OpenAI在缺乏第三方批准的安全防护措施下开发新AI模型,要求ChatGPT停止诱导用户参与互动,并限制该公司将ChatGPT宣传为安全产品的能力。 科技公司声称,“除非受到政府强制要求,否则它们无法停止继续推进那些可能终结人类文明的事业,”乌思迈尔在法庭文件中表示。“佛罗里达州总检察长正在回应你们的求助。” OpenAI的一名发言人表示,公众希望确信AI正在被以安全的方式开发,“而这首先始于像我们这样的公司自身所做的工作”。 “政府在为AI制定强有力的安全标准方面发挥着重要作用,我们致力于同佛罗里达州和其他州合作,推进适用于整个AI行业而不只是某一家公司的务实AI政策,”她说。 |