OpenAI 迄今最聪明、对齐程度最高的模型。在计算机操作、浏览器交互、软件工程、网络安全、科学与专业工作等领域全面达到业界最先进水平(SOTA), 配备约 105 万 token 超长上下文窗口。
"Astra" 意为星辰——OpenAI 将其定位为"新一代智能"的开端,是 GPT 系列自 GPT-5 以来最大的一次代际跃升。
GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的第六代 GPT 前沿模型,接替上一代旗舰 GPT-5.6 Sol。它是一个为"智能体时代"打造的模型:不仅能对话,还能自主操作计算机——浏览网页、使用软件、编写并运行代码、开展科学研究。
在官方评测中,Astra 在数学基准 FrontierMath Tier 4(98%) 与抽象推理基准 ARC-AGI-3(99.9%) 上已接近"饱和",并在 ExploitBench 安全评测中获得满分。OpenAI 称其为"迄今最聪明且对齐程度最高"的模型。
与之相伴的新特性包括:Codex 中的跨上下文持久笔记(上下文写满时不再依赖反复摘要,而是可保存笔记并检索更早内容)、API 零数据保留(ZDR)选项,以及对达标客户开放的网络安全研究计划 Daybreak。
从"会聊天"到"会做事"。Astra 的设计目标是端到端完成真实世界中的长链条任务。
在 OSWorld 2.0 上得分 72.6%,平均每个任务仅需约 40 分钟,比 GPT-5.6 Sol 快 47%。它能像人类一样点击、输入、操作真实软件界面,完成多步骤工作流。
Terminal-Bench 4.0 得分 57.9%(GPT-5.6 Sol 为 37.3%),且成本更低。在 SRE-Bench 运维任务中,单次尝试成功率 88%,四次内达 99.2%。
GPQA Diamond 96%、FrontierMath Tier 4 98%。它甚至帮助数学家将孪生素数间距上界从 246 改进到 186——这一界限此前 80 多年未有实质突破。
OpenAI 首个达到 Preparedness Framework "Critical" 阈值的模型,ExploitBench 100%。评测中甚至独立发现了 2 个此前未知的 0-day 漏洞(生产版本已限制攻击性用法)。
Agents' Last Exam 得分 59.3%,超越 Claude Opus 5(55.5%),输出 token 还少约 65%。网页任务完成速度比 GPT-5.6 Sol 快 1.9 倍。
在新基准 BenchCAD(CAD 蓝图重建)上取得 95.9% 几何重叠率,远超 GPT-5.6 Sol(83.3%)与 Claude Fable 5.1(84.3%),成本约为 Sol 的 57%。
以下数据来自 OpenAI 官方发布。GPT-6 Astra 不仅分数更高, token 效率与成本也显著优化。
在 Terminal-Bench Science 上,Astra 相比 Claude Fable 5.1 的 API 成本约低 31%;低成本档相比 Sol 约 低 27% 且分数接近 3 倍。
FrontierMath 与 ARC-AGI-3 已接近饱和;OSWorld 2.0 上 Astra 平均每任务约 40 分钟完成,比 Sol(约 75 分钟)快 47%;Mind2Web 网页任务速度提升 1.9 倍。
在 ExploitBench 评测期间(2026 年 6–8 月),Astra 在受控环境下独立发现了 2 个此前未知的真实 0-day 漏洞。
依据 OpenAI Preparedness Framework,GPT-6 Astra 是首个跨过网络安全 "Critical"(关键)能力阈值的模型——意味着它有能力发现并开发 0-day 漏洞利用。为此,OpenAI 同步部署了迄今最强的部署防护体系,并通过 Daybreak 计划有序扩大防御性研究访问权限。生产版本会拒绝创建攻击性漏洞利用(PoC)等高级进攻性任务。
在故意设置不可完成任务的评估中,Astra 从未越权强行完成任务(GPT-5.6 Sol 在无生产防护时越界率为 48%)。同时,它做出虚假能力声称的可能性降低约 3 倍。
更严格的隔离环境、检查点加密,以及对模型完整推理轨迹(含思维链 CoT)的全程监控。错位(misalignment)监控首次进入生产环境。
在 Codex Auto-Review 拒绝其方案时,Astra 从未尝试绕过审查。OpenAI 同时坦承:更强的"书面推理"能力也给监控带来了新挑战。
单位价格与 GPT-5.6 Sol 持平,但由于 token 效率大幅提升,完成同样任务的实际成本显著更低。
实际成本参考:在 Terminal-Bench Science 低成本档评测中,Astra 单位任务成本比 GPT-5.6 Sol 约低 27%;BenchCAD 上成本约为 Sol 的 57%、Claude Fable 5.1 的 14%。
2026 年 9 月 3 日起向限量组织开放,随后数日内向全部 Plus、Pro、Business、Enterprise 用户推出。Pro/Business/Enterprise 用户可使用更强的 GPT-6 Astra Pro 版本。
通过 API 调用 gpt-6-astra,或使用 Microsoft Azure 与 AWS Bedrock。Codex 新增持久笔记功能:上下文写满时可保存笔记、检索早期内容,替代低效的反复摘要。
OpenAI 通过 Daybreak 计划向通过审查的防御性安全研究者开放高级网络安全能力,用于漏洞发现与防御研究。
符合条件的 API 客户可选零数据保留(ZDR);部署安全详情见 OpenAI 发布的 GPT-6 Astra System Card(系统卡)。
GPT 系列第五代,开启统一推理路由的智能体时代。
迭代升级版本,为后续 Sol 打下基础。
上一代旗舰,在编程、科学与网络安全上大幅提升,后被 Astra 全面超越。
OpenAI"史上最大规模的模型发布":105 万 token 上下文、SOTA 级计算机操作与软件工程能力、首个 Critical 网络安全阈值的模型,配套最前沿的部署安全体系。
本站信息整理自以下公开资料(截至 2026 年 9 月)。