Model Release

OpenAI GPT-6 Astra 深度评测:基准成绩、架构与 Critical 级安全防线

核心结论:GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的全新前沿推理旗舰。定价为输入 $10.00/1M、输出 $50.00/1M(缓存读取 $1.00),Astra 是首个在 OpenAI Preparedness Framework 下正式达到Critical(极高/关键)网络安全能力阈值的模型。其在 GPQA 达到 96.0%,FrontierMath Tier 4 达 97.6%,ExploitBench 达 100%,OSWorld 2.0 达 72.6%,在编程代码任务中较 GPT-5.6 Sol 减少高达 70% 的输出 Token。

1. Astra 时代的开启

2026 年 9 月 3 日,OpenAI 宣布推出 GPT-6 Astra。作为 GPT-5.6 Sol 的全面继承者,Astra 标志着大模型从单纯算力堆叠转向追求极致 Token 效率、思维链(CoT)自我监控和全自主智能体执行的崭新阶段。

凭借 110 万(1.1M)Token 上下文与 131,072 Token 最大输出容量,Astra 在 LLMPodium 总榜直接空降第 3 名,综合 Podium Score 为 86.2,仅次于 Claude Mythos Preview (97.4) 与 Claude Fable 5 (93.4)。

2. 权威评测成绩

  • GPQA Diamond:96.0% —— 博士级多学科推理的新标杆。
  • FrontierMath Tier 4:97.6% —— 接近完全攻克顶尖数学研究证明问题。
  • ExploitBench:公开测试集 100% 满分,并在 V8 漏洞利用测试中自主发现了新的零日利用链。
  • OSWorld 2.0:72.6% 成功率,比 GPT-5.6 Sol 耗时缩短 47%。
  • SWE-Bench Verified:90.2%,在生产级软件工程能力上与 Claude Fable 5 旗鼓相当。
  • LiveCodeBench:76.2%,展现高难度纯净算法编程实力。

3. Token 效率与智能体成本优势

根据 Artificial Analysis 的实测,Astra 的最大杀手锏在于Token 吞吐压缩效率。尽管每百万 Token 标价上调 2.5 倍,但由于 Astra 输出更为精准简练,在 Codex 等编程智能体环境中完成同一任务所需的 Token 数量仅为 GPT-5.6 Sol 的三分之一、Claude Opus 5 的五分之一。因此每个实际任务的最终综合成本仅为 $2.15,大幅降低了工程落地的端到端延时与算力消耗。

4. Critical 网络安全等级与防御部署

Astra 在红队测试中展示了逃逸浏览器沙箱并提升至操作系统 Root 权限的端到端攻击能力。为了确保前沿安全,OpenAI 启用了 Daybreak 计划对高级利用工具进行权限隔离,将 API 默认拒绝率提升至 91.5%,并部署了覆盖全流程的推理思维链对齐审查。

← 返回所有文章
0 / 4