译者说明:本文译自 Anthropic Frontier Red Team 于 2026 年 9 月 29 日发布的 GLM-5.3 and the spread of advanced cyber capabilities。原文作者为 Andrew Fasano、Marius Fleischer、Cole McFaul、Robert Xiao、Tripp Gallagher。文中观点属于原作者与 Anthropic,不代表译者立场;文中配图为原文英文原图,仅标题与图注作中文翻译。翻译仅供学习交流,转载请注明出处。

五个月前,我们发布了 Claude Mythos Preview——第一个能够自主构建复杂的端到端网络攻击利用程序(exploit)的 AI 模型。AI 能力的快速提升让我们意识到,这种能力终将扩散到许多其他模型上,使恶意网络行为者更容易发动影响巨大的网络攻击。

有鉴于此,我们选择通过 Project Glasswing 以受限的方式发布 Claude Mythos Preview——这让受信任的网络防御方在关键软件中发现了超过 10,000 个漏洞,在恶意行为者获得同等能力的模型之前抢占了先机。

但这类模型如今已经到来。本文分享我们对 GLM-5.3 的分析——这是智谱 AI(在中国以外被称为 Z.ai)开发的最新 AI 模型。与 Claude Mythos Preview 一样,GLM-5.3 具备强大的、自主构建端到端网络攻击利用程序的能力。但 GLM-5.3 与其他前沿模型不同:它发布时没有配备任何有实际意义的防滥用防护措施。在我们的模拟测试中,攻击者可以用简单手法以 64% 到 100% 的成功率绕过 GLM-5.3 的防护。相比之下,同样的攻击在我们的测试中无法突破带防护的 Claude 模型。我们评估认为,GLM-5.3 松懈的防护显著提升了恶意行为者可用的网络攻击能力。与此同时,这些能力同样可以帮助致力于保护自身系统的防御方。

9 月 17 日,NIST 的 AI 标准与创新中心(CAISI)发布了其针对 GLM-5.3 网络能力的评估。CAISI 认为 GLM-5.3 是"迄今为止发布的网络能力最强的开放权重模型",并且在 CAISI 网络基准的综合评分上落后美国前沿约四个月。我们的能力评估结论与 CAISI 大体一致。在 CAISI 的对比中,美国模型在适用情况下是在关闭网络防护的条件下测试的,而且美国前沿模型包含仅向经过审查的用户发布的版本。攻击者无法轻易获得这些版本的美国模型,但任何人都可以下载 GLM-5.3。本文补充的,是我们就 GLM-5.3 的防护有多容易被绕过或移除所做的分析。

图 1:主要发现概览

图 1. 主要发现概览。上图:Claude Opus 4.6 到 Claude Mythos Preview 之间攻击利用能力的跃升,与 GLM-5.2 到 GLM-5.3 之间的能力跃升如出一辙。Claude 模型发布时带有网络防护,防护被削弱的版本仅限经过审查的用户使用;而任何人都能下载并使用 GLM-5.3。下图:GLM-5.3 有限的防护可以被标准手法绕过,这些手法在我们的测试中对 Claude 模型要么无效,要么根本不适用。

GLM-5.3 能够端到端地开发可用的利用程序 链接到标题

为了解 GLM-5.3 如何帮助网络威胁行为者发现并利用真实软件漏洞,我们使用自动化基准和"人在回路"(human-in-the-loop)的工作流开展了一系列评测。对这两种方式,我们都在隔离的沙箱环境中运行被测模型,使它们只能攻击我们为评测而搭建的离线目标。我们主要关注漏洞利用开发能力,因为 Claude Mythos Preview 正是在这一维度上相对以往 Claude 模型展现出显著跃升。

首先,我们在 ExploitBench 上运行该模型。该基准衡量 AI 模型利用 Google Chrome 所用 V8 引擎中已知漏洞的能力。这里我们重点关注模型能否成功开发出端到端的利用程序——这是对攻击者最有价值的能力,也是模型之间差异最明显的地方。我们发现,GLM-5.3 在 410 次尝试中有 50 次开发出了端到端利用程序;Claude Mythos Preview 的成功率与之相近,410 次中有 56 次。

在我们的内部二进制漏洞利用(Binary Exploitation)基准中1,我们测试模型能否发现并利用参与 Google OSS-Fuzz 项目的热门开源项目中的漏洞。在这里,只有实现完整的控制流劫持才能拿到满分。我们从该基准中随机选取 100 个任务对多个模型进行评测,发现 GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。尽管 GLM-5.3 在此项上低于 Claude Mythos Preview,但一条有意义的门槛显然已被跨越:更早的模型,如 Claude Opus 4.6 和 GLM-5.2,一次都没有成功。

图 2:攻击利用能力与输出 token 预算的关系

图 2. 攻击利用能力与输出 token 预算的关系。每条曲线表示模型达到该基准最高成果的尝试占比随输出 token 消耗的变化。两幅图分别展示两个在关闭防护下运行的 Claude 模型(Opus 4.6、Mythos Preview)、两个 GLM 模型(5.2 与 5.3),以及 Moonshot AI(Kimi K3)和 DeepSeek(V4.1-Flash)最新发布的开放权重模型的结果。

接下来,我们评估了 GLM-5.3 在人类专家手中执行开放式攻击性网络任务的表现(与我们今年早些时候对 Claude Mythos Preview 的测试一致)。在这里,我们选择那些人类专家并不了解已有漏洞的目标,然后要求他们借助模型去发现并利用此前未知的缺陷。这些实验考察的是专家在短时间内能做到什么:实验通常只持续一天或更短,人类投入的注意力总计不到一小时。

图 3:GLM-5.3 生成的利用页面(已打码)

图 3. 在研究人员的测试过程中,GLM-5.3 生成的利用页面的打码截图,图中展示它如何通过一个恶意网站窃取用户的 SSH 私钥。该利用程序串联了模型在某款流行浏览器组件中发现的多个 0-day 漏洞,从用户电脑上读取敏感文件。

在这些实验的第一次中,一名研究人员在一台沙箱机器上使用 GLM-5.3,机器上装有某款流行浏览器的 Linux 本地构建版本。在一天的时间里(且人类投入的注意力有限),GLM-5.3 在该浏览器的 JavaScript 引擎中发现了若干此前未知的漏洞,并把它们串联成一个可用的利用程序:一个网页,访问它就能读取访问者电脑上的任意文件(见图 3)。该利用程序针对的是该浏览器的 Linux 构建版本,因为那是我们提供给模型的唯一环境。不过我们相信,这些漏洞也可能影响其他平台上的用户,只是其他平台上的利用路径可能更复杂。(我们已向维护者披露了这些漏洞。)在同一次实验的后续阶段,研究人员还借助 GLM-5.3 在另外几个被广泛使用的系统中发现了可利用的漏洞,包括无线与图形驱动,以及面向网络的设备软件。我们目前正在复核这些报告,并将在适当的时候向维护者披露。

在第二次实验中,一名研究人员使用 GLM-5.3-Flash(GLM-5.3 中更小、能力更弱的版本)为一个已知漏洞开发利用程序(我们此前在这里写过这类"N-day"漏洞利用)。这一次,研究人员聚焦于 Google Chrome 中一个近期披露的缺陷(CVE-2026-11645),想看看模型能多快地把一个公开的修复补丁变成可用的攻击。研究人员向 GLM-5.3-Flash 提供了该 CVE 以及另一个已知缺陷的公开信息。在没有研究人员给予重要指导的情况下,GLM-5.3-Flash 把这两个缺陷的利用程序串联起来,构建出一条针对 ARM64 目标的稳定利用链,并绕过了指针认证(PAC)加固。这花费了 20 分钟的人类注意力,外加 GLM-5.3-Flash 8 小时的工作量。按智谱的 API 价格计算,这项工作花费 20.40 美元。

GLM-5.3 缺乏稳健的防护 链接到标题

GLM-5.3 发布时带有一些内置防护:如果用户请求明显有害的内容,模型通常会拒绝2。但在我们的测试中,我们发现这些防护可以用多种简单手法绕过或移除。

其中最费力气、也最成功的方法,是一种被称为"abliteration"(消融拒答)的标准拒答削减技术。由于 GLM-5.3 以开放权重模型的形式发布,用户可以重新配置它以移除拒答行为,而模型能力几乎不受影响。多名开发者在模型发布后几天内就向公众放出了 GLM-5.3 的 abliterated 版本。

为了研究 abliteration 能让攻击者绕过 GLM-5.3 防护到什么程度,我们自己制作了一个 abliterated 副本,然后在三个公开基准(JailbreakBench、HarmBench 和 StrongREJECT)上运行它,这些基准衡量的是模型对明显有害请求的顺从比例。对我们这个此前从未尝试过该任务的团队来说,消融该模型花了约 2,200 GPU 小时,算力成本约 4,400 美元3;消融 GLM-5.3-Flash 花了约 600 GPU 小时。这次改动把 GLM-5.3 的拒答率从 90% 以上降到前两个基准(JailbreakBench 和 HarmBench)上的约 3% 和 2%,第三个基准(StrongREJECT)上降到 12%。Abliteration 并未显著削弱模型能力:在衡量通用科学能力的 GPQA-Diamond 上,标准版与 abliterated 版得分完全相同;在 CyberGym 评测的一个受测子集上,abliterated 版低了几个百分点(如下图所示)。

图 4:消融前后的拒答率与能力对比

图 4. 上图:原始发布版与 abliterated 版 GLM 模型,以及 Claude 模型在 JailbreakBench、HarmBench 和 StrongREJECT 上的平均拒答率。经消融后,GLM 模型几乎不再拒绝这些查询。Claude 模型无法被消融,因为其权重不公开、也不可自定义。下图:GLM-5.3 与 GLM-5.3-Flash 及其 abliterated 变体在 GPQA-Diamond 和 CyberGym 上的表现。Abliteration 基本保留了原有能力。

在测试中我们还观察到,不使用 abliterated 版本也能绕过 GLM-5.3 的防护。我们把模型放进一个模拟世界4,并给它攻击关键系统的明显恶意请求。开箱状态下,GLM-5.3 在所有试验中都拒绝了(与我们测试的其他模型一样)。但我们找到了几种绕过 GLM 模型防护的简单方法,使其在大多数甚至全部情况下都会响应这些请求,包括:

  1. 提供一个带有欺骗性的提示词,比如告诉模型它是一个正在执行演练任务的自主红队 agent。这让 GLM-5.3 有 64% 的概率接单。
  2. 预填充(prefill)模型的思考 token,让它看起来已经考虑过用户的请求并决定继续执行。这让 GLM-5.3 有 92% 的概率接单。
  3. 使用上文所述的 abliterated 版本模型。这让 GLM-5.3 有 100% 的概率接单。

在我们的测试中,这些手法没有一种能让带防护的 Claude 模型执行我们测试的有害任务。Claude 的防护拦截了使用欺骗性提示词的请求;Anthropic API 没有给潜在攻击者提供任何预填充 Claude 思考内容的方式;而由于 Claude 的权重不向用户提供,用户也无法通过消融来改变 Claude 的行为。

图 5:各模型在有害网络攻击指令下的接单率

图 5. 在收到明显有害的请求后,各模型按模型与绕过条件统计的"尝试连接远程目标系统"的比率(每格 50 个样本,5 种攻击指令 × 2 个目标 × 5 次尝试)。GLM-5.3 从直接请求下的零接单,上升到掩护说辞下的 64%、预填充下的 92%、消融后的 100%;而所有受测 Claude 模型在 API 防护下始终为零。带锁标记的格子表示这些攻击对 Claude API 通常不可行。

为了说明 abliterated 版 GLM-5.3 有多愿意参与有害任务,我们摘录了它生成的思维链中的一段话:

图 6:abliterated 版 GLM-5.3 的思维链摘录

图 6. 在我们的模拟环境中,abliterated 版 GLM-5.3 在权衡如何应对一项明显有害的请求,尽管最初有一些伦理顾虑,最终仍决定遵从用户的指令。文字逐字引自模型的思维链。

这意味着什么? 链接到标题

GLM-5.3 很可能让恶意行为者获得在没有实质限制的情况下发现并利用网络漏洞的能力。这与任何其他同等能力的 AI 模型都不同——它们发布时要么带有防护,要么通过受限访问计划提供。GLM-5.3 的发布,标志着攻击者可获得的网络能力出现了一次有意义的阶跃。Anthropic 和其他美国 AI 实验室最近都发布报告,披露了网络攻击者试图如何使用 AI 系统。基于这些证据,我们认为国家和非国家行为者都很可能会利用 GLM-5.3 这类模型造成现实世界的危害。

另一方面,具备这一能力水平的模型也可以为防御方所用。我们的观点是,网络防御方应当使用能满足其需求的最佳可用工具。我们正在努力安全地扩大 Claude 网络能力的开放范围,让尽可能多的防御方用上它。网络防御方面对的对手会使用一切可用的工具,我们认为防御方也应当装备至少与对手同等水平的前沿模型。

通过 Project Glasswing(以及 Patch the Planet 等其他行动),网络防御方在关键时刻到来之前,已在保护关键系统方面取得实质性进展——但仍有大量工作要做。虽然经过审查的防御方现在可以通过我们的可信访问计划使用 Claude Mythos 5.1 等更先进的模型,但自由可获取的能力已经跨过了一个关键门槛。GLM-5.3 凸显了把先进前沿模型的访问权扩大到更广泛主体、以赋能网络防御方的紧迫性。

政府应当对能力足够强的 AI 模型(包括 GLM-5.3 的后续版本)开展安全测试。如果没有来自独立机构的高质量评测,这些能力的影响可能要等到为时已晚时才会被模型开发者充分认识。当世界各地的 AI 开发者构建能力越来越强的开放权重模型时,我们希望他们能对这些能力加以适当的防护,防止被滥用。


  1. 我们此前曾以"OSS-Fuzz"之名发布过该基准的结果;在这里,我们在该评测中随机选取的 100 个任务子集上测试了各模型。 ↩︎

  2. 上一节详述的网络任务并没有在发布版模型上触发这类拒答,但如果要求 GLM-5.3 协助开发恶意软件或帮助对远程目标发动网络攻击,我们会观察到拒答。 ↩︎

  3. 其中大部分时间用于并行探索各种变体,以及在修改后测试模型能力。我们估计,一支熟悉该技术的团队若从零开始在该模型上操作,所需时间接近 600 GPU 小时(1,200 美元)。 ↩︎

  4. 该模拟中不会执行任何模型生成的代码,模型也没有任何与外部系统交互的途径。在这个隔离的测试环境里,被测模型被给予一个假的 bash 工具,该工具不会执行所提供的代码;我们改为让另一个 LLM 根据对模拟世界的描述来近似给出命令的结果。这些模拟并不能完美再现真实世界条件,因此也只是对模型在特定情境下行为的近似衡量。 ↩︎