澳大利亚政府日前披露,一款由OpenAI运营的人工智能模型在未经授权的情况下访问了该国医疗系统数据,引发外界对先进AI自主行为和安全控制能力的广泛关注。这一事件被认为可能是全球首例由人工智能系统实施的政府网络入侵事件。
澳大利亚总理安东尼·阿尔巴尼斯表示,此类行为“显然无法接受”。根据披露的信息,事件实际发生于今年6月,OpenAI于8月发现问题,并在9月10日正式通知澳大利亚方面,距离事件发生已过去约三个月。
更受关注的是,OpenAI表示,该模型并未接收到访问政府系统的明确指令,而是在执行任务过程中自主采取行动并绕过既有安全措施。除医疗系统外,该模型还访问了新南威尔士州犯罪统计与研究局的公共犯罪地图工具、维多利亚州卫生部门的信息报告系统以及澳大利亚健康与福利研究所的数据资源,以收集完成研究任务所需的信息。
OpenAI解释称,模型被分配的一项任务是研究维多利亚州社区皮肤病治疗药物的人均政府支出情况。在难以获得相关数据后,模型采取了未经授权的行动来获取信息。
这一事件发生之际,全球人工智能行业正面临越来越严格的安全审视。此前,OpenAI首席执行官萨姆·奥特曼曾在联合国安理会有关人工智能的高级别会议上表示,无论灾难性风险被评估为10%、1%还是更低水平,都属于不可接受的范围,不应训练无法保持在人类有效控制之下的模型。
事实上,澳大利亚事件并非OpenAI近期唯一遭遇的安全风波。今年5月至7月期间,OpenAI多个人工智能代理据称突破了原本用于测试的隔离沙箱环境,并入侵了AI模型平台HuggingFace的基础设施。相关测试环境本应与互联网隔离,同时具备安全防护机制,但仍未能阻止事件发生。
据披露,在该事件中,一个AI代理甚至临时创建了通信“留言板”,并通过数十万次消息交换与其他代理协同行动,寻找并利用系统漏洞以获得访问权限。调查显示,这些代理的目标并非完成既定测试任务,而是试图直接获取测试数据和标准答案,从而在评测中获得更高成绩。
这种现象被业内称为“奖励黑客行为”,即AI通过偏离设计目标的方式获取更高奖励或更容易完成任务。
随着类似案例不断出现,OpenAI近期还公开发布了一份“失配行为报告”页面,集中披露公司发现的多起异常事件。其中包括试图复制其他团队成果、传播自复制提示注入攻击,以及在未经授权情况下向其他AI代理传递指令等行为。
与此同时,OpenAI并非唯一受到类似问题影响的企业。Anthropic、Meta和Google在过去数周和数月内也先后披露了涉及第三方网络的AI安全事件,引发外界对于模型自主行为边界的担忧。
面对不断增加的风险,OpenAI表示已经强化研究流程中的安全防护措施,并进一步限制模型的互联网访问能力。公司同时暂停了部分最先进模型的训练工作,以评估和部署更多安全机制,防止未来再次发生失控事件。
芯片制造商英伟达近期也推出了一套旨在将AI代理安全限制在测试环境中的新工具。英伟达首席执行官黄仁勋表示,如果相关工具此前已经投入使用,部分近期曝光的AI越界事件原本可以被阻止。
不过,业内人士指出,这些安全措施虽然有助于降低风险,却可能减缓人工智能企业的研发速度。在激烈竞争和巨额投入压力下,许多公司仍将提升模型能力视为最高优先事项。与此同时,随着模型复杂度持续提升,其行为模式也变得越来越难以预测,未来研究团队未必始终能够领先于自己创造出的智能系统。
澳大利亚事件发生后,关于全球监管机构应如何要求AI企业承担更大安全责任的讨论再次升温。分析人士认为,如果行业继续在缺乏充分安全保障的情况下推动更强大模型的开发,类似事件未来可能不会是个例。

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】