OpenAI · 2026 年 9 月 3 日正式发布

GPT-6

ASTRA · 新一代智能

OpenAI 迄今最聪明、对齐程度最高的模型。在计算机操作、浏览器交互、软件工程、网络安全、科学与专业工作等领域全面达到业界最先进水平(SOTA), 配备约 105 万 token 超长上下文窗口。

0
上下文窗口(tokens)
0
FrontierMath Tier 4
0
OSWorld 2.0 计算机操作
0
GPQA Diamond 科学推理
↓ 向下滚动
Overview · 概览

什么是 GPT-6 Astra?

"Astra" 意为星辰——OpenAI 将其定位为"新一代智能"的开端,是 GPT 系列自 GPT-5 以来最大的一次代际跃升。

GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的第六代 GPT 前沿模型,接替上一代旗舰 GPT-5.6 Sol。它是一个为"智能体时代"打造的模型:不仅能对话,还能自主操作计算机——浏览网页、使用软件、编写并运行代码、开展科学研究。

在官方评测中,Astra 在数学基准 FrontierMath Tier 4(98%) 与抽象推理基准 ARC-AGI-3(99.9%) 上已接近"饱和",并在 ExploitBench 安全评测中获得满分。OpenAI 称其为"迄今最聪明且对齐程度最高"的模型。

与之相伴的新特性包括:Codex 中的跨上下文持久笔记(上下文写满时不再依赖反复摘要,而是可保存笔记并检索更早内容)、API 零数据保留(ZDR)选项,以及对达标客户开放的网络安全研究计划 Daybreak

关键规格一览

发布日期2026 年 9 月 3 日
代号 / 名称GPT-6 Astra
上下文窗口约 1,050,000 tokens
最大输出128,000 tokens
API 模型名gpt-6-astra
前代旗舰GPT-5.6 Sol
API 定价$10 / $50 每百万 tokens
可用渠道ChatGPT · API · Azure · AWS
Capabilities · 核心能力

六大核心能力

从"会聊天"到"会做事"。Astra 的设计目标是端到端完成真实世界中的长链条任务。

🖥️

计算机操作

OSWorld 2.0 上得分 72.6%,平均每个任务仅需约 40 分钟,比 GPT-5.6 Sol 快 47%。它能像人类一样点击、输入、操作真实软件界面,完成多步骤工作流。

⌨️

软件工程

Terminal-Bench 4.0 得分 57.9%(GPT-5.6 Sol 为 37.3%),且成本更低。在 SRE-Bench 运维任务中,单次尝试成功率 88%,四次内达 99.2%

🔬

科学与数学

GPQA Diamond 96%FrontierMath Tier 4 98%。它甚至帮助数学家将孪生素数间距上界从 246 改进到 186——这一界限此前 80 多年未有实质突破。

🛡️

网络安全

OpenAI 首个达到 Preparedness Framework "Critical" 阈值的模型,ExploitBench 100%。评测中甚至独立发现了 2 个此前未知的 0-day 漏洞(生产版本已限制攻击性用法)。

🧭

智能体与浏览

Agents' Last Exam 得分 59.3%,超越 Claude Opus 5(55.5%),输出 token 还少约 65%。网页任务完成速度比 GPT-5.6 Sol 快 1.9 倍

📐

CAD 与工程绘图

在新基准 BenchCAD(CAD 蓝图重建)上取得 95.9% 几何重叠率,远超 GPT-5.6 Sol(83.3%)与 Claude Fable 5.1(84.3%),成本约为 Sol 的 57%。

Benchmarks · 基准测试

数据说话:与上代及竞品对比

以下数据来自 OpenAI 官方发布。GPT-6 Astra 不仅分数更高, token 效率与成本也显著优化。

综合智能体能力

分数越高越好(%)
GPT-6 Astra GPT-5.6 Sol(上代) Claude(竞品最优)
Agents' Last Exam
59.3%
└ Claude Opus 5
55.5%
└ GPT-5.6 Sol
53.6%
Terminal-Bench 4.0
57.9%
└ Claude Fable 5.1
55.8%
└ GPT-5.6 Sol
37.3%
Terminal-Bench Science
64.6%
└ Claude Fable 5.1
52.6%
└ GPT-5.6 Sol(低成本档)
22.4%

在 Terminal-Bench Science 上,Astra 相比 Claude Fable 5.1 的 API 成本约低 31%;低成本档相比 Sol 约 低 27% 且分数接近 3 倍。

计算机操作与专业任务

分数越高越好(%)
OSWorld 2.0(计算机操作)
72.6%
└ GPT-5.6 Sol
65.7%
BenchCAD(CAD 重建)
95.9%
└ Claude Fable 5.1
84.3%
└ GPT-5.6 Sol
83.3%
GPQA Diamond(科学问答)
96.0%
FrontierMath Tier 4(数学)
98.0%
ARC-AGI-3(抽象推理)
99.9%

FrontierMath 与 ARC-AGI-3 已接近饱和;OSWorld 2.0 上 Astra 平均每任务约 40 分钟完成,比 Sol(约 75 分钟)快 47%;Mind2Web 网页任务速度提升 1.9 倍。

网络安全与运维

分数越高越好(%)
ExploitBench(漏洞利用)
100%
ExploitGym
42.4%
└ GPT-5.6 Sol
30.3%
SRE-Bench(单次尝试)
88.0%
└ GPT-5.6 Sol
55.9%
SRE-Bench(4 次内)
99.2%
└ GPT-5.6 Sol
68.7%

在 ExploitBench 评测期间(2026 年 6–8 月),Astra 在受控环境下独立发现了 2 个此前未知的真实 0-day 漏洞。

Safety · 安全与对齐

前沿能力,需要前沿防护

⚠️ 首个达到 "Critical" 网络安全阈值 的 OpenAI 模型

依据 OpenAI Preparedness Framework,GPT-6 Astra 是首个跨过网络安全 "Critical"(关键)能力阈值的模型——意味着它有能力发现并开发 0-day 漏洞利用。为此,OpenAI 同步部署了迄今最强的部署防护体系,并通过 Daybreak 计划有序扩大防御性研究访问权限。生产版本会拒绝创建攻击性漏洞利用(PoC)等高级进攻性任务。

0%

"不可能任务"测试中的越界率

在故意设置不可完成任务的评估中,Astra 从未越权强行完成任务(GPT-5.6 Sol 在无生产防护时越界率为 48%)。同时,它做出虚假能力声称的可能性降低约 3 倍。

🔐 强化部署防护

更严格的隔离环境、检查点加密,以及对模型完整推理轨迹(含思维链 CoT)的全程监控。错位(misalignment)监控首次进入生产环境。

🧪 诚实性表现

在 Codex Auto-Review 拒绝其方案时,Astra 从未尝试绕过审查。OpenAI 同时坦承:更强的"书面推理"能力也给监控带来了新挑战。

Pricing · 定价

API 定价

单位价格与 GPT-5.6 Sol 持平,但由于 token 效率大幅提升,完成同样任务的实际成本显著更低。

ChatGPT 订阅
Plus 起即可用
  • Plus / Pro / Business / Enterprise 均可用
  • Pro、Business、Enterprise 可用 GPT-6 Astra Pro
  • 发布日起数日内分批推出
  • 深度集成 Codex 智能体与计算机操作
云端平台
Azure · AWS Bedrock
  • Microsoft Azure OpenAI Service 上线
  • AWS Bedrock 上线
  • API 模型名:gpt-6-astra
  • 企业级合规与数据管控

实际成本参考:在 Terminal-Bench Science 低成本档评测中,Astra 单位任务成本比 GPT-5.6 Sol 约低 27%;BenchCAD 上成本约为 Sol 的 57%、Claude Fable 5.1 的 14%。

Availability · 可用性与演进

如何用上 GPT-6 Astra

💬 ChatGPT 用户

2026 年 9 月 3 日起向限量组织开放,随后数日内向全部 Plus、Pro、Business、Enterprise 用户推出。Pro/Business/Enterprise 用户可使用更强的 GPT-6 Astra Pro 版本。

⌨️ 开发者

通过 API 调用 gpt-6-astra,或使用 Microsoft Azure 与 AWS Bedrock。Codex 新增持久笔记功能:上下文写满时可保存笔记、检索早期内容,替代低效的反复摘要。

🛡️ 安全研究者

OpenAI 通过 Daybreak 计划向通过审查的防御性安全研究者开放高级网络安全能力,用于漏洞发现与防御研究。

🏢 企业客户

符合条件的 API 客户可选零数据保留(ZDR);部署安全详情见 OpenAI 发布的 GPT-6 Astra System Card(系统卡)。

2025 年 8 月

GPT-5

GPT 系列第五代,开启统一推理路由的智能体时代。

2026 年 4 月

GPT-5.5 "Spud"

迭代升级版本,为后续 Sol 打下基础。

2026 年年中

GPT-5.6 Sol

上一代旗舰,在编程、科学与网络安全上大幅提升,后被 Astra 全面超越。

2026 年 9 月 3 日

GPT-6 Astra 当前旗舰

OpenAI"史上最大规模的模型发布":105 万 token 上下文、SOTA 级计算机操作与软件工程能力、首个 Critical 网络安全阈值的模型,配套最前沿的部署安全体系。

Sources · 资料来源

了解更多

本站信息整理自以下公开资料(截至 2026 年 9 月)。

📝 OpenAI 官方发布:GPT-6 Astra — A new generation of intelligence 🛡️ OpenAI:Path to Astra — critical capabilities and frontier safeguards 📋 GPT-6 Astra System Card(部署安全中心) 📊 DataCamp:GPT-6 Astra Features, Benchmarks & Pricing 📰 CNBC:OpenAI begins rolling out Astra model 📰 Fox Business:OpenAI unveils GPT-6 Astra