
9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,官方将其定位为“全球最强、也最对齐的模型”。这款模型在推理、计算机操作、浏览、软件工程、网络安全、科学与专业工作等多个维度达到行业最先进水平。
事件背景
过去一年,前沿模型的竞赛焦点从纯文本推理延伸到“替人类操作电脑”的能力。Astra 的发布,标志着基础模型正从“会对话”走向“会干活”。
核心内容
在关键基准上,Astra 几乎触及天花板:FrontierMath Tier 4 得分 98%,已帮助解决长期悬而未决的数学开放问题;ARC-AGI-3 得分 99.9%,在 96% 的关卡上超越人类动作效率基线;ExploitBench 得分 100%。
工程规格同样惊人:上下文窗口达 105 万 token,最大输出 12.8 万 token,支持文本与图像输入、文本输出,并内置网页搜索、文件搜索、代码编写与执行能力。其 API 标准定价为每百万输入 token 10 美元、每百万输出 token 50 美元。
在计算机使用方面,Astra 在 OSWorld 2.0 延迟模拟中以约 47% 更少的时间完成单任务(72.6% vs 65.7%);在 Mind2Web 基准上较 GPT-5.6 Sol 实现 1.9 倍更快的任务完成。安全层面,面对困难或不可能任务时“越权”的比例从 GPT-5.6 Sol 的 48% 降至 0%。
影响与解读
Astra 已通过 OpenAI API、Microsoft Azure 与 AWS Bedrock 向可信访问企业客户开放,并将逐步覆盖 ChatGPT 订阅用户。对行业而言,其意义不仅在于分数提升,更在于把“多步骤专业工作流”的可执行性推到了新高度。
信息来源:OpenAI 官方博客(GPT-6 Astra: A new generation of intelligence)。

评论(0)