跳到主要内容

智谱GLM-5.3意外炼出“挖洞”能力:发现2436个漏洞平均潜伏26.6年,权重开放在即引发安全格局之变

Public

2026年8月14日——智谱AI(Z.ai)发布GLM-5.3时做了一件此前没有任何主流开放权重实验室做过的事:向付费客户交付模型,却暂缓发布权重。原因不是常规的安全措辞,而是一项公司声称“并非刻意构建”的能力——在后期训练中加入漏洞发现数据后,产出的模型展现出跨多个漏洞利用阶段推理的能力,能将发现、验证与利用串联成连贯的攻击计划。与中国的安全团队合作,该模型已在269个开源项目中发现2436个漏洞,其中1097个为严重或高危级别,平均潜伏26.6年未被发现,最老的漏洞可追溯至约1981年。

能力画像:CyberGym登顶,ExploitBench刻意留白

GLM-5.3基于与GLM-5.2相同的743B参数基座,全部提升来自扩展的后期训练。除编码能力较前代提升50%(内部评估)外,其网络能力呈现一个耐人寻味的分裂:

  • CyberGym漏洞发现基准:84.5%,超过Anthropic的Mythos 5(83.8%)与GPT-5.6 Sol(83.6%);
  • ExploitBench漏洞利用基准:54.4%,显著落后于领先闭源模型的78.0%。

智谱将这一不对称定位为刻意为之的防御姿态——模型被调优为发现漏洞而非武器化漏洞。发布首日,GLM-5.3即识别出AI代码编辑器Cursor中的一处潜在严重漏洞,经私下披露后Cursor正与智谱协作修复。智谱在cvd.z.ai运营协调披露台账:53个已公开披露并分配CVE编号,2383个仍在维护者修补期间处于保密状态。

权重延迟发布:一个真正的新事件

为期约两周的权重暂缓期是整个发布中最值得琢磨的细节。

安全研究界指出其结构性意义:前沿级漏洞发现能力此前一直是受限访问的——谷歌DeepMind的Gemini 3.5 Flash Cyber作为专用漏洞模型仅向经审查的政府用户开放,“限制”本身就是其安全论证的全部。但这种论证只在能力停留在可随时吊销的API之后时才成立。开放权重发布不是一次产品上线,而是对威胁格局的永久性改变。

GLM-5.3自身的存在就是证明:整个能力跃升来自对同一基座模型的后期训练。一旦权重公开,任何拥有适度GPU预算的人都可以进行后期训练——54.4%与78.0%之间在漏洞利用生成上的差距,将不再是政策决定,而变成“谁先下载文件”的工程练习。

26.6年:真正应该被记住的数字

抛开基准测试,发现清单本身更值得深究:2436个漏洞横跨内核、操作系统、浏览器、基础设施与协议实现,平均潜伏26.6年——最老的漏洞几乎与IBM PC同龄。

这不是一个“AI很聪明”的故事,而是一个关于“你的产品依赖着多少未被审视的代码”的故事。其中每个漏洞都熬过了数十年的人工审查、静态分析乃至主动安全研究,只因为没有人有耐心或预算去认真看。现在,“看”的经济学变了。此前已有AI智能体以约1000美元的成本在FFmpeg中挖出21个零日(含潜伏23年的老bug),Chrome也基于AI辅助发现连续三个版本发布了1442项修复。

令人不安的算术是:发现的规模已经扩张,消化的规模没有。你的依赖树不会因为其中发现更多bug而修补得更快——相反,发现的洪流让分诊变得更难,基于严重度的分诊机制已在量级冲击下开始崩溃。

辖域与情报集中度问题

2383个漏洞目前处于一家中国公司运营的注册表保密状态。中国的《国家情报法》对智谱在该窗口期内持有的信息创设了法律义务——这是关于法律风险的事实陈述,而非对行为的指控,此类考量应进入风险评估而非停留在评论区。

对多数中小企业,这不是回避该模型的理由,而是思考“如果运营披露项目,向谁提交发现”的理由——尤其当基础设施处于具有明显战略利益的行业时。硬币的另一面同样成立:2383个保密状态的漏洞广泛存在于常用开源项目中,意味着大量预披露知识集中于一处,而补丁将按你不掌握的时间表落地。

该做的事:窗口期行动清单

在权重发布前的窗口期,安全团队可以做的六件事:

  1. 把依赖清单做实,包括软件成分分析工具看不见的部分:静态链接的C库、嵌入式浏览器运行时、捆绑的SQLite、多年前复制进来的代码——26.6年的平均潜伏期告诉你这些模型高产的领域在哪,不在应用层;
  2. 度量你的平均修补时间,并将其当作唯一重要的数字——发现率不是你能影响的变量,但“补丁存在”到“生产环境就位”的间隔完全属于你;
  3. 在洪流到来前修好分诊模型——严重度优先排序在几百条发现时就会崩溃,可利用性与可达性分析、EPSS评分与书面的“我们不修这个及原因”路径,现在建立都比事发时便宜;
  4. 决定内部运行开放权重模型的立场——防御性调优的模型在你的自有代码中找bug,对没有安全预算的团队是真实的机会,自托管也避免源代码进入第三方推理日志;
  5. 订阅与实际技术栈相关的通告,而不仅是语言生态的——当2383项保密发现在内核、协议实现与基础设施项目中落地时,包管理器上的自动依赖告警看不到其中大部分;
  6. 写清楚谁来做决定——如果关键通告在周五下午落在依赖树第四层的某个库里,需要有人有权不经规划会议直接发布紧急补丁。现在就把名字写下来。

底层规律

能力先出现在API之后,以安全理由受限,然后一个开放权重的实现让限制失去意义——这个模式我们在持久执行、边缘数据库、有状态无服务器原语上都见过。这次的不同在于,被开放的能力是进攻性安全研究本身,而且没有任何版本的故事里,金库的大门会重新关上。

AI安全漏洞挖掘GLM-5.3智谱AI大模型
0