
9月30日,Google DeepMind 正式发布下一代旗舰大模型 Gemini 4 Argon。这是 Gemini 4 系列的首款模型,也是谷歌时隔七个多月再次推出前沿(frontier)模型。与前代不同,Argon 将长周期软件工程、企业知识工作与网络防御作为核心定位,并以「分阶段、防御者优先」的方式限量开放。
事件背景
自 GPT-6 Astra、Claude Opus 5.5 等旗舰模型陆续发布以来,大模型竞争已从单纯的参数与跑分,转向长上下文、智能体化与垂直场景落地。谷歌此前主推的 Gemini 3.8 Flash 在开发者中口碑稳定,但市场一直期待一款更能对标对手旗舰的「大块头」。Argon 正是在这一背景下登场。
核心内容
Argon 最引人注目的技术变化是输出长度跃升至 100 万 token(此前为 6.4 万),模型得以在单次轨迹中「深度思考」并完成超长多步任务。谷歌称其在真实软件工程、法律与金融等知识工作以及网络防御上达到前沿水平。
在基准测试上,谷歌公布的官方成绩包括:DeepSWE v1.1(真实长周期软件工程)77.9%,AutomationBench(端到端业务执行)51.3% 并列第一,LVBench(长视频理解)91.7%,CWE-bench v1(漏洞修复)68% 并列第一。在多项经济任务评测 Vals Index 上,Argon 取得 68.9%,高于 GPT-6 Astra 的 63.1% 与 Opus 5.5 的 67.0%。
定价方面,Argon 以尝鲜价每百万输入 token 2 美元、输出 10 美元开放,缓存输入折扣达 95%;后续标准价将升至 4/20 美元。
值得关注的是其发布节奏:谷歌通过名为 Fairwind Program 的计划,先向「可信网络防御者」开放,并参与美国政府自愿性预发布审查流程,之后才逐步向付费 API 客户、Google AI Ultra 及企业、消费者扩展。这一「防御者优先」的分阶段策略,被外界解读为谷歌主动对标自身《前沿安全框架》的谨慎姿态,也引发「安全作秀」的调侃。
影响与解读
Argon 的限量开放凸显了头部实验室对前沿模型滥用风险的警惕。将网络漏洞发现能力先交给防御方、并保留「无护栏版本」用于内部验证,折射出攻防双刃剑的现实张力。从产业角度看,100 万 token 输出配合更低定价,将进一步压低长任务与智能体场景的使用门槛。
相关动态
谷歌同时宣布用「Skills」取代此前的「Gems」提示词模板,并沿用 Anthropic 开创的代理提示词格式;Gems 将于 2026 年 11 月起逐步停用。这表明主流产品正在加速趋同于「智能体化」的交互范式。
信息来源:Google DeepMind 官方、TPS Report、IT之家、ExplainX

评论(0)