Google 于 2026 年 9 月 30 日公布 Gemini 4 Argon,但首批开放对象是部分网络安全合作伙伴,并非所有 Gemini 用户都能获得的普遍升级。The Verge 当天报道了这一公告。对开发者与安全团队而言,当下应先确认自己是否符合访问条件,以及能否在获得授权的流程中评估模型;一则公告本身并不能让它成为生产系统的依赖。
Fairwind 访问资格附带运行要求
Google 的公告表示,后续扩大开放将从付费 API 客户和 Google AI Ultra 订阅者开始,但没有给出日期。这是计划中的开放顺序,并不保证 Ultra 账号今天就能使用 Argon。10 月 2 日查阅的 Gemini API 公共模型目录尚未列出 Argon。
Fairwind 计划让一组选定伙伴提前获得防御性网络安全用途的访问权限。申请者需要接受审核,提交表格不等于获准使用。规则要求用户身份认证、可抵御网络钓鱼的多因素认证、访问控制以及员工使用记录。访问范围仅限内部网络安全、事件响应或渗透测试团队,且不得转售或转分发。
Google 表示,将向可信防御者和内部团队提供不带网络安全任务护栏的 Argon。但 Fairwind 仍将允许的双重用途任务限定为经过授权的防御工作或学术研究。两者属于不同层面的控制:放宽模型限制,并不免除组织界定可测试系统范围及服务使用人员的责任。
一百万输出 token 是预算,不是成功指标
Google 将公布的输出上限从 64,000 token 提高到一百万,以支持持续较长时间的推理过程。这说的是输出额度,而不是输入上下文窗口能容纳多少文档,也不能证明每项任务都需要用满这一上限。
我们的判断是,团队应把完成的工作与获得结果所需的资源一并评估。在限定执行范围内通过审查的迁移方案,比篇幅更长但仍有未解决错误的答案更有价值。对具有代表性的任务,应记录耗时、token 消耗、修正次数,以及最终代码或文档。保留现有流程作为对照,才能避免把一次出色演示直接变成未经测量的替代方案。
选模型前先阅读评测条件
DeepMind 的评测方法文档说明,结果通常采用单次尝试评分和最高推理设置,并列出例外情况。Argon 的若干分数由 Google 自行计算,而其他模型的对照数字可能来自供应商报告或公开排行榜。文档还说明了内部漏洞数据集及不同评测配置。
因此,这些结果更适合作为开展自有测试的线索,不能视为所有模型在完全相同企业任务上的受控比较。编程基准分数不能证明补丁通过某个组织的回归测试;内部漏洞测试分数也不能证明模型覆盖一款陌生应用的风险。在把醒目的分数用于部署决定前,应先检查评测框架、可用工具及任务定义。
扩大开放期间先准备范围明确的评估
符合条件的安全团队可以申请 Fairwind,并准备少量经过授权的调查任务,设定清晰的停止条件。计划之外的开发者也可以准备相同的评估材料,同时继续使用自己实际能够访问的模型。两类团队都无需假定未经文档确认的 API 地址或发布日期。
先使用可弃置的环境,并预先设定验收标准。拟议修复进入生产系统前,应由人员审查;同时比较新流程与现有流程遗漏的缺陷,以及不必要的修改。这是针对已公布能力的编辑评估建议;TechKili 没有测试 Argon。采用与否应取决于可访问、可重复的试验,而不是输出预算的大小。