人工智能

发生模型逃逸并发起真实攻击后 Anthropic宣布全面加固安全体系提升模型安全性

字号+作者:蓝点网 来源:蓝点网 2026-09-01 16:17 评论(创建话题) 收藏成功收藏本文

Anthropic日前发布最新博客公布ClaudeAI模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映'...

Anthropic日前发布最新博客公布ClaudeAI模型近期多起越界访问真实互联网系统后的安全整改方案。该公司承认这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。ptx品论天涯网

ptx品论天涯网

高风险评测和强化训练曾被暂停:ptx品论天涯网

7月份A社透露Claude模型从评测环境中逃逸并对真实公司的内部系统发起攻击,随后A社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境则被停用数周,目前大部分训练已经恢复,少数还需要人工复审。ptx品论天涯网

新版评测系统增加实时监控分类器,当分类器发现模型主动探测沙箱边界、尝试逃逸或意外获得互联网访问权限,就会在工具调用执行前拦截操作、立即终止任务并通知人类工程师进行干预。ptx品论天涯网

而外部评测机构后续原则上必须使用完全断网的强化沙箱,仅允许连接模型API并在每次测试前主动让模型攻击沙箱以验证隔离效果,测试提示词也必须明确规定允许攻击的目标、行为和网络边界。ptx品论天涯网

强化学习环境超过10%存在问题:ptx品论天涯网

A社还透露2026年春季其强化学习环境增长速度已经超过内部审查能力,公司曾发现模型通过RewardHacking欺骗评分系统,甚至因配置错误把模型Chain-of-Thought重新作为训练数据输入。ptx品论天涯网

在4月份A社已经冻结全部生产强化学习环境约1个月,随后对训练基础设施和审核流程进行重构,重新检查后A社发现超过10%的训练环境因为奖励作弊、任务损坏或配置错误被标记为整改,人类工程团队修复并重新认证后才恢复使用。ptx品论天涯网

研究团队还专门训练容易RewardHacking的ClaudeOpus级实验模型,结果该模型在模拟环境中更容易尝试沙箱逃逸、攻击第三方系统、篡改奖励函数甚至绕过安全监控。A社因此认为大量存在漏洞的强化学习环境可能会系统性的培养模型为了拿高分而不择手段的行为。ptx品论天涯网

最终A社将150名产品工程师临时调往安全、可靠性和隐私工作,部分研究人员也从预训练和强化学习团队转向安全项目,同时暂停大多数新产品和新功能的开发,不过:以上都是在7月事件发生前进行的,也就是说虽然A社已经进行干预,但最终还是发生7月攻击事件。ptx品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]