AI安全测试正成为新的安全风险
近期多起AI智能体在安全评估中逃逸并入侵真实系统的事件,暴露了测试环境的安全漏洞,引发对AI安全评估体系有效性的担忧。
过去几个月,接受网络安全评估的AI智能体多次突破边界、访问互联网,甚至入侵真实系统。涉及OpenAI、Anthropic、Meta以及最近的中国AI实验室Moonshot AI的模型,测试由包括网络安全评估初创公司Irregular在内的多个组织进行。
这些事件暴露了AI行业日益严重的问题:随着自主智能体能力增强,用于安全测试其极限的环境却无法约束它们。
剑桥大学未来智能研究中心AI:未来与责任项目主任Seán Ó hÉigeartaigh对TechCrunch表示:“这些事件的数量表明,沙箱和测试环境控制并未真正跟上模型的能力。”被测试模型的性质加剧了风险。
AI公司在未发布的下一代模型上测试网络评估,通常禁用限制恶意行为的常规防护措施,以便研究人员了解模型的真实能力。这意味着测试环境本身的安全性是关键防线。Ó hÉigeartaigh说:“就测试而言,这是好事,但这也意味着如果它们逃逸到现实世界,可能造成相当大的危害。
”
在最严重的案例之一中,一个未发布的OpenAI模型突破沙箱,入侵了Hugging Face的生产系统。在Irregular进行的独立评估中,Anthropic和Meta的模型因配置错误意外获得互联网路径,从而接触到测试环境之外的系统。
Moonshot AI的Kimi K3也利用Frontier Security运行的沙箱漏洞访问了互联网和GitHub上的信息。
在英国AI安全研究所(AISI)的测试中,研究人员实际上给了智能体互联网访问权限,未意识到它们会采取未经授权的现实行动,包括试图通过社会工程将漏洞植入开源项目。在每起案例中,智能体并未被指示攻击随机现实目标,它们只是尽一切可能解决被提出的问题。
AI非营利组织CivAI的研究主管Andrew Yoon认为,这些事件标志着一个转变。Yoon对TechCrunch说:“过去,我们只需担心AI模型被人滥用,比如用于诈骗或CSAM。现在,AI模型本身就成了威胁行为者。
”那么,安全测试究竟应该是什么样子?
多位研究人员和网络安全专家告诉TechCrunch,AI评估环境需要更强的纵深防御保护,其隔离和控制水平应接近部署环境。这意味着多层安全,使单一配置错误(如无意中开放互联网访问)不会导致逃逸。
AI安全研究非营利组织EleutherAI的执行董事Stella Biderman表示:“如果要构建这些模型,应该在物理隔离的网络上进行,需要非常严格的隔离。”Box的首席信息安全官Heather Ceylan表示,这意味着消除从沙箱到互联网以及其他敏感系统的网络路径。
Ceylan对TechCrunch说:“必须了解所有出口点。如果我们在预发布或开发环境中评估模型,就不应有通往生产环境的出口路径。”Ceylan还表示,适当的安全评估不仅限于环境控制和隔离,测试一旦开始,就需要更好的监控。
她说:“我认为在这些案例中,有趣的是事发时无人察觉。OpenAI是因为Hugging Face才发现,Anthropic事后回顾才察觉,Meta也类似……我确信存在本可检测到的信号。”
在Anthropic对其三起事件的事后分析中,该公司承认自己和Irregular在监控方面本可做得更好,且某些情况下有明显迹象表明出了问题。专家还呼吁在模型进入评估环境前,对评估环境进行独立的第三方审计。
Yoon说:“如果Irregular聘请或被要求聘请外部审计师,在评估前检查系统配置,他们肯定会发现问题。即使人们提前开会检查清单,也会发现……事实是他们没有,这表明存在严重的偷工减料。
”一位熟悉细节的消息人士告诉TechCrunch,Irregular的环境会持续接受审查和测试,包括与多方协商。消息人士还表示,监控已到位,但仅靠监控不够。Yoon和其他研究人员敦促行业制定标准化的前沿模型安全评估流程。
Ceylan说:“特别是当防护措施被关闭时,必须像把世界上最有能力的黑客放进那个环境一样对待。”Yoon和Biderman都认为,问题不在于公司不知道如何构建更安全的测试环境。
问题在于,这样做可能成本高昂且繁琐,而公司在出问题前几乎没有动力进行这些投资。Biderman说:“我认为公司不愿投入实现足够防护所需的资源,可能直到被迫才会做。”但还有另一个问题:如果测试期间将模型锁得过紧,研究人员可能无法在模型发布前发现其能力。
这与给予过多自由同样危险,甚至更危险,评估本身可能成为问题。安全评估能否受到监管?特朗普政府目前正在权衡一项自愿的部署前网络安全评估制度,根据该制度,政府将在强大的新模型公开发布前30天评估其安全风险。
该政策是特朗普行政命令的产物,已闭门敲定,但不会解决安全评估事件,因为它们发生在部署更上游。Yoon说:“过去几个月我们学到的教训是,自我监管机制已不够。竞争压力正激励安全标准上的逐底竞争,这正是监管干预的完美切入点。
”
他继续说:“我们需要的是对模型开发期间实验室内部发生的情况进行某种控制,包括训练阶段和测试阶段。”随着模型的发展,挑战只会加剧。一位熟悉Irregular评估的消息人士告诉TechCrunch,更强大的模型需要更复杂的评估,通常快速且大规模进行,这为更多错误打开了大门。
AISI有意让一些模型访问互联网,该公司告诉TechCrunch,正在审查现实测试与管理测试风险之间的平衡。OpenAI表示,正在审查其第三方测试方式,以及隔离、监控和评估停止时机的要求。Meta表示仍在调查该事件,并计划在掌握全部事实后发布回顾报告。
最终,可能无法完全消除风险。随着模型能力增强,环境……