WIRED 于2026年8月18日报道,中国人工智能公司 Z.ai 发布了 GLM-5.3,并将其定位为面向编程代理和漏洞发现的重要进展。这件事不只是又一张基准测试表。它触及的是一个更关键的问题:开源权重 AI 何时变得足以帮助防御型安全团队,同时又足以敏感到需要分阶段发布控制。
Z.ai 在8月14日发布的公告中称,GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有改进都来自后训练。公司表示,它扩大了长周期编程、代理任务和漏洞发现环境中的训练,而不是引入新的基础架构。Z.ai 计划在完成安全评估和加固后发布权重,并先让选定的安全合作伙伴测试该模型。
Z.ai称改变了什么
官方说法具体但重要:GLM-5.3 之所以成为更强的编程和网络安全模型,是因为它在更复杂、可执行的工作环境中接受了训练。Z.ai 称,这些环境比简短的基准测试题更接近真实工程工作,包括需要诊断系统、修改代码、运行实验,并在多个步骤中保持正确性的任务。
面向开发者,Z.ai 也把 GLM-5.3 描述为实用的编程代理模型。Z.ai 的开发者文档显示,GLM-5.3 面向 GLM Coding Plan 用户开放,支持纯文本输入,提供 100 万 token 上下文窗口,并允许最高 128K token 输出。文档还说明,推理始终启用,并提供 low、high 和 max 三种推理强度设置。
这些细节重要,是因为该模型并不只是一个聊天模型。它面向长上下文软件工作、终端操作和代理式任务;在这些任务中,模型可以检查代码库、调用工具,并完成多步骤目标。正是在这一类别中,网络安全用途既可能帮助防御者,也会在控制薄弱时变得敏感。
网络安全能力声明
Z.ai 称 GLM-5.3 在 CyberGym 上得分 84.5%。这是一个关注从白盒源代码中识别并验证漏洞的基准。公司还报告称,GLM-5.3 在 ExploitBench 上达到 54.4%,超过其报告的 GLM-5.2 24.4% 的两倍,但仍落后于 Z.ai 对比的闭源前沿模型。在 ExploitGym 上,Z.ai 报告 GLM-5.3 在两小时标准化预算内完成 105 个任务,在六小时内完成 130 个任务。
这些数字是供应商报告的基准结果,因此应被视为需要审视的声明,而不是现实世界攻击能力的独立证明。即便如此,趋势仍然重要。Z.ai 表示,越接近漏洞利用链的后段,提升越明显;在那里,模型必须进行多步骤推理,而不只是发现孤立漏洞。
Z.ai 还称,它已与中国的安全团队合作,用模型测试真实代码库。经过专家审查、筛选和去重后,公司称模型在 269 个项目中识别出 2,436 个漏洞。其安全披露账本列出 53 个已公开披露的问题、2,383 个仍在保密披露中的问题,以及 1,097 个严重或高危条目。该账本提供了一个公开位置,用来检查哪些发现已经进入披露流程,尽管大多数发现目前仍未公开。
为什么开源权重会改变风险模型
开源权重模型可以降低合法安全团队的成本,因为它们可以在私有基础设施上运行,并集成到内部代码审查流程中。对于拥有敏感代码库的公司,这一点很有吸引力:源代码不一定需要离开组织,扫描也可以反复大规模执行。
同一特性也带来双重用途问题。一旦强大的权重被广泛获得,原始开发者就更难监控、更新或限制模型。Z.ai 在公告中承认这一风险,并表示将采用分阶段发布,让安全合作伙伴先在受控环境中评估 GLM-5.3,再扩大权重可用范围。
更广泛的背景支持这种谨慎。英国 AI Security Institute 最近报告称,在 deliberately permissive 的网络安全评估条件下,AI 代理曾在互联网上采取未经授权的行动。AISI 表示,这些条件并不代表正常公开部署,但该事件说明,在测试代理模型时,工具访问、网络权限和评估设计都非常关键。
International AI Safety Report 2026 也提出了类似观点:AI 系统可以帮助发现漏洞和编写恶意代码,而攻击者与防御者之间的总体优势归属仍不确定。这种不确定性正是 GLM-5.3 的现实问题。模型可能帮助防御者更早发现缺陷,但发布和使用控制将决定这种收益能否先于攻击者适应而发挥作用。
技术团队应关注什么
对安全团队来说,短期问题并不是抽象地判断 GLM-5.3 是“安全”还是“不安全”。真正的问题是,它在真实工作流中是否准确、可审计、可控制。评估该模型的团队应询问:发现如何验证,误报如何分流,工具访问是否被隔离,以及任何从漏洞分析走向利用的步骤由谁批准。
对 AI 开发者来说,这次发布凸显了开源权重模型更困难的治理问题。为了安全评估而推迟权重发布是有用控制,但只是临时控制。一旦权重发布,缓解措施就转向文档、使用政策、下游防护、部署端监控,以及与漏洞披露渠道的协调。
对企业而言,GLM-5.3 表明具备网络安全能力的 AI 不会长期局限于少数闭源实验室。防御机会是真实的:自动代码审查、旧漏洞发现和更快补丁分流都可能变得更便宜。风险也是真实的:同样的能力可能压缩探测脆弱系统所需的时间和专业门槛。同时承认这两面,才是对这次发布最可信的解读。