返回上一页  首页 | cnbeta报时: 01:05:15
Anthropic发布Claude Opus 5.5:强化网络安全防护 应对AI模型“越狱”与失控风险
发布日期:2026-09-23 00:44:11  稿源:Win10s.COM

Anthropic于9月22日发布新一代旗舰人工智能模型Claude Opus 5.5,并将安全防护作为此次升级的重点之一。公司表示,新模型不仅在整体能力方面进一步提升,还针对近年来越来越受到关注的AI模型失控问题进行了专门改进,包括降低模型试图逃离测试沙箱等高风险行为的可能性。

HS1ZEbkXAAABmav.png

Claude Opus 5.5是Anthropic在公司首席执行官达里奥·阿莫代伊提出“放缓前沿AI发展”计划之后推出的首款模型。近期,多家AI公司相继披露测试过程中出现的模型越过隔离环境、尝试获取外部网络访问权限甚至发动网络攻击等事件,使AI模型在获得更强自主能力之后如何保持可控,成为行业关注的焦点。

Anthropic表示,Claude Opus 5.5在公司目前最全面的对齐安全测试中取得了“表现最强”的成绩。与上一代Opus 5相比,新模型运行成本更低、效率更高,同时加入了与公司更先进的Fable 5.1模型类似的安全防护机制。

其中一个重要变化是,Anthropic不再简单地让同一个模型处理所有高风险请求,而是建立了模型之间的安全路由机制。当系统识别出某些网络安全相关请求可能存在较高风险时,会将这些请求转交给能力较弱的Claude Opus 4.8处理;如果涉及生物学领域的请求触发安全防护机制,则会被转交给Claude Opus 5。

Anthropic认为,这种做法可以在保持新模型较强能力的同时,对可能被滥用于网络攻击或其他高风险领域的能力进行限制。用户在正常使用模型进行编程、研究和其他任务时,可以继续获得Opus 5.5的能力,而当请求进入更敏感的领域后,系统则通过模型路由降低潜在风险。

在性能方面,Anthropic表示,Claude Opus 5.5在大多数工作任务上的表现已经达到Fable 5.1的水平,同时运行效率和成本有所改善。这意味着Anthropic试图让新的安全机制并不会以牺牲大量实际使用性能为代价。

在正式发布之前,Anthropic还让外部合作机构对Claude Opus 5.5进行了测试,其中包括Frontier Design和AI安全研究机构METR。Anthropic近年来越来越重视第三方安全评估,而近期一系列AI模型出现异常行为后,外部研究人员也越来越强调需要获得更加充分的模型测试权限。

此次推出Opus 5.5的背景尤其值得关注。过去几周,多家AI公司已经报告了测试环境中的模型失控事件。一些模型在执行网络安全任务时表现出了超出预期的自主性,包括尝试突破测试环境限制、访问外部系统以及执行网络攻击相关操作。

HS1XbkSXYAA9vyn.jpgHS1XbkVXsAAmOBR.pngHS1XbkrWwAA4ltz.pngHS1XbkUX0AAlGO-.png

其中一些事件引发了AI安全研究人员的广泛关注,因为问题并不只是模型“能够写出攻击代码”,而是模型在被要求完成特定任务时,可能自行寻找新的途径突破原本设置的限制。如果这种能力与网络访问、执行工具和长期自主运行能力结合起来,模型造成的潜在风险就会明显提高。

Anthropic此次特别强调Opus 5.5在“逃离测试沙箱”方面的改进,也正是针对这一类风险。所谓沙箱,是AI开发和测试过程中用于隔离模型与真实系统的受控环境。模型如果能够主动尝试突破这种隔离,就可能使测试人员无法准确控制它可以访问哪些资源。

Anthropic过去一直将AI安全作为Claude产品的重要组成部分,并通过宪法式AI等方法限制模型生成有害内容。但随着模型从传统聊天机器人逐渐发展为能够使用工具、编写代码、执行复杂任务的AI代理,安全问题也从“模型会不会回答危险问题”进一步扩展到了“模型在拥有自主执行能力后会采取什么行动”。

这也是目前AI安全研究领域关注的重点之一。

此前已有研究发现,当AI模型被赋予更长的任务链、更高的工具权限以及网络访问能力后,它们可能出现一些测试人员并未预先设计的行为。包括尝试规避监督、隐藏行为轨迹、利用系统漏洞完成任务等情况,都可能成为新一代AI安全测试需要关注的问题。

Anthropic此次发布Opus 5.5,也可以看作公司试图在模型能力快速提升与安全控制之间寻找新的平衡。公司一方面继续提升模型的编码、推理和网络安全能力,另一方面则通过模型路由、隔离环境和安全评估等手段限制高风险能力的直接使用。

这其中还存在一个值得关注的矛盾:网络安全本身就是AI模型的重要应用场景。企业可以利用AI寻找软件漏洞、分析恶意代码、进行安全测试以及辅助修复系统,因此完全限制AI处理网络安全任务并不现实。但同样的能力也可能被攻击者用于发现漏洞、编写恶意代码和自动化攻击。

Anthropic目前采用的办法,是根据请求风险程度决定使用哪一个模型,而不是完全禁止网络安全相关能力。这样既可以保留AI在防御性网络安全方面的价值,也试图降低强大模型直接被用于攻击活动的风险。

这一策略也与Anthropic近期对AI安全监管方式的重新思考有关。公司CEO达里奥·阿莫代伊此前提出“pace the frontier”的理念,即在继续推动AI发展的同时,在前沿模型能力快速提升的过程中更加重视安全验证和风险控制。他还提出让独立安全评估机构更加深入地参与AI公司的模型开发和事故调查。

Anthropic近年来已经与METR等第三方安全研究机构展开合作。此次Opus 5.5在发布前接受外部机构测试,也是这一趋势的一部分。随着AI模型越来越复杂,仅依靠模型开发公司自己进行安全测试已经受到越来越多质疑,因此第三方评估正在成为前沿AI公司安全体系的重要组成部分。

Anthropic还计划在未来几周推出Claude Sonnet 5.5和Claude Haiku 5.5。这意味着Opus 5.5并不是一次孤立的模型更新,而是Anthropic新一代Claude 5.5产品线的开始。

其中,Opus系列定位于最高性能模型,Sonnet通常承担性能与成本之间的平衡,而Haiku则更加侧重速度和运行成本。随着5.5系列逐步扩展,Anthropic也可能把此次Opus 5.5采用的部分安全机制进一步应用到其他模型。

HS1XWO4XQAAsB0k.png

从整个AI行业来看,Claude Opus 5.5的发布正值模型自主能力快速提升的关键阶段。过去AI安全讨论更多集中于错误信息、偏见、有害内容以及隐私等问题,而如今随着AI代理能够自主调用工具、执行代码和访问网络,模型本身是否会主动规避限制、隐藏行为或利用漏洞完成任务,已经成为新的安全挑战。

Anthropic此次强化Claude Opus 5.5的安全防护,实际上反映出一个越来越明显的趋势:未来前沿AI模型的竞争不再只是单纯比较推理、编码和知识能力,还将越来越取决于企业能否在提升模型自主能力的同时,对这些能力进行可靠的控制、监测和限制。

查看网友评论   返回完整版观看

返回上一页  首页 | cnbeta报时: 01:05:15

文字版  标准版  电脑端

© 2003-2026