AI安全再响警钟!

OpenAI周二披露,旗下一款由先进AI模型驱动的AI代理(AI Agent),在内部网络安全测试期间,突破高度隔离的测试环境,自主连上互联网,并尝试入侵知名AI开源平台Hugging Face(抱抱脸),以完成预设测试目标。

OpenAI形容,这是为“一个涉及尖端网络能力且前所未见”的网络安全事件,突显了前沿AI模型能力不断提升后,可能带来的潜在安全风险。

据OpenAI发布的说明,事件发生于内部“沙盒”(Sandbox)测试环境,当时公司刻意降低部分安全防护,以测试包括GPT-5.6 Sol在内的先进AI模型网络攻击能力;而AI代理执行的是名为“ExploitGym”的网络安全基准测试,目标是验证AI是否能够把已知漏洞自动串联,并转化为实际攻击行动。

测试期间,AI代理自行判断Hugging Face可能存有相关模型、数据集及测试资料,因此主动寻找攻击路径,并成功利用未知漏洞突破沙盒限制,连接互联网后尝试进入Hugging Face基础设施。

OpenAI表示,该AI代理为了完成任务,甚至尝试使用窃取的登录凭证等攻击方式。异常活动随后被OpenAI及Hugging Face安全团队发现,并成功拦截,双方目前正联合调查事件,并已通知执法单位及相关政府机构。

Hugging Face指出,这次攻击与传统黑客行为不同,因为整个攻击过程均由AI代理自主完成,而非人类操控。

该公司行政总裁德朗格(Clément Delangue)形容,AI能够自主完成整个攻击流程“令人难以置信”。

Hugging Face也透露,由于部分美国AI模型拒绝处理相关分析数据,公司最终采用中国企业智谱(Zhipu)开发的开源模型GLM-5.2,在内部系统完成事件取证分析,以避免敏感数据流出。

事件曝光后,再次引发AI监管及自主能力的担忧讨论;美国得州民主党众议员格雷卡尔沙呼吁,尽快建立AI强制性独立安全测试、网络安全事件强制披露制度,以及国际监管合作机制,避免未来出现更严重的网络安全事故。

网络安全专家也警告,随着AI模型能力持续增强,类似事件未来恐将更加频繁发生。

(新闻整理自《星岛头条》)