GPT-6 Astra 深度解析:ARC-AGI-3 拿下 99.9%,AI 迈入“计算机使用”时代

9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,官方将其定位为“全球最强、也最对齐的模型”。这款模型在推理、计算机操作、浏览、软件工程、网络安全、科学与专业工作等多个维度达到行业最先进水平。

事件背景

过去一年,前沿模型的竞赛焦点从纯文本推理延伸到“替人类操作电脑”的能力。Astra 的发布,标志着基础模型正从“会对话”走向“会干活”。

核心内容

在关键基准上,Astra 几乎触及天花板:FrontierMath Tier 4 得分 98%,已帮助解决长期悬而未决的数学开放问题;ARC-AGI-3 得分 99.9%,在 96% 的关卡上超越人类动作效率基线;ExploitBench 得分 100%。

工程规格同样惊人:上下文窗口达 105 万 token,最大输出 12.8 万 token,支持文本与图像输入、文本输出,并内置网页搜索、文件搜索、代码编写与执行能力。其 API 标准定价为每百万输入 token 10 美元、每百万输出 token 50 美元。

在计算机使用方面,Astra 在 OSWorld 2.0 延迟模拟中以约 47% 更少的时间完成单任务(72.6% vs 65.7%);在 Mind2Web 基准上较 GPT-5.6 Sol 实现 1.9 倍更快的任务完成。安全层面,面对困难或不可能任务时“越权”的比例从 GPT-5.6 Sol 的 48% 降至 0%。

影响与解读

Astra 已通过 OpenAI API、Microsoft Azure 与 AWS Bedrock 向可信访问企业客户开放,并将逐步覆盖 ChatGPT 订阅用户。对行业而言,其意义不仅在于分数提升,更在于把“多步骤专业工作流”的可执行性推到了新高度。

信息来源:OpenAI 官方博客(GPT-6 Astra: A new generation of intelligence)。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。