GPT-6 Astra全量推送:能力追平Claude Fable 5,OpenAI重返“黄金时代”

OpenAI全量推送GPT-6 Astra模型 单任务成本较前代降低43%

北京时间9月8日,OpenAI正式向所有ChatGPT付费用户全量推送GPT-6 Astra模型。距离该模型于9月4日凌晨发布已过去四天,期间因访问权限限制引发的争议随着全量开放逐渐平息。此次推送标志着OpenAI在智能体(Agent)能力上的重大跃升,模型从单纯的内容生成转向复杂工作流的自主执行。

实测GPT-6 Astra:曾经的那个OpenAI,回来了
实测GPT-6 Astra:曾经的那个OpenAI,回来了

GPT-6 Astra的发布节奏曾引发部分用户不满。9月4日发布后,模型仅面向少量机构开放,普通付费用户需等待数日。OpenAI总裁Greg Brockman随后确认,为补偿用户等待期,平台将对受影响账户进行额度重置。截至9月5日,模型开始分批推送,至9月8日实现全量覆盖。尽管初期存在访问障碍,但早期评测数据显示,Astra在多项基准测试中表现显著优于前代产品。

在核心能力评估中,Astra展现出较强的自主规划与执行能力。官方数据显示,在ARC-AGI-3测试中,Astra得分达到99.9%,远超GPT-5.6 Sol的7.8%;在漏洞利用测试ExploitBench中获得满分100分,高于前代的78.5分。在研究级数学基准FrontierMath Tier 4上,Astra取得97.6%的成绩,接近测试上限。OSWorld 2.0测试显示,Astra完成常见桌面任务的平均用时约为40分钟,完成率为72.6%,优于GPT-5.6 Sol的75分钟和65.7%。

实测GPT-6 Astra:曾经的那个OpenAI,回来了
实测GPT-6 Astra:曾经的那个OpenAI,回来了

然而,Astra并非在所有维度均实现全面领先。Artificial Analysis发布的智能指数评测显示,Astra与GPT-5.6 Sol均获得61分。在Coding Agent Index编码代理测试中,Astra得分为67分,与Anthropic的Claude Fable 5持平,但低于Fable 5.1的70分。部分早期测试者指出,Astra在创意写作场景中的表现略有回落,在其自建的文风基准测试中排名第11位,而GPT-5.6 Sol排名第6位。

定价策略方面,GPT-6 Astra的API价格为每百万输入Token 10美元、输出Token 50美元,分别是GPT-5.6 Sol的2.5倍。上下文窗口扩展至105万Token,最大输出12.8万Token,知识截止时间更新至2026年4月30日。尽管单价上涨,但实际使用成本因效率提升而下降。Artificial Analysis测试表明,在最大推理强度下,Astra消耗的Token数量约为GPT-5.6 Sol的三分之一。

实测GPT-6 Astra:曾经的那个OpenAI,回来了
实测GPT-6 Astra:曾经的那个OpenAI,回来了

开源证券2026年9月7日发布的《计算机行业点评报告》指出,在BenchCAD基准测试中,Astra的单��务估算成本较GPT-5.6 Sol降低约43%,较Claude Fable 5.1降低约86%。银河证券同日发布的研究报告认为,企业级AI部署的经济性评估正从Token单价转向任务总成本。实际案例显示,游戏公司Playco测试中人工修复量减少50%;财务科技公司Legora利用Astra在数分钟内完成41份文件审核并识别出4处错误。

技术架构层面,Astra的训练依托于得克萨斯州Stargate基地的超大规模算力集群。英伟达CEO黄仁勋确认,该模型由超过10万块NVIDIA Grace Blackwell GPU组成的NVLink72集群训练完成。此外,Astra是首款由前代模型深度参与训练监督的产品,OpenAI通过构建“AI监督AI”闭环,降低了训练流程对人工运维的依赖。

实测GPT-6 Astra:曾经的那个OpenAI,回来了
实测GPT-6 Astra:曾经的那个OpenAI,回来了

随着模型能力的跃升,人机协作模式面临调整。早期用户反馈显示,此前为GPT-5.6 Sol制定的复杂限制性指令在Astra面前显得冗余。许多用户在切换至新模型后,选择简化全局规则文档,仅保留核心偏好说明,以激发模型的自主工作能力。这一现象反映出,当模型具备更高阶的逻辑推理与执行能力时,人类的角色正从详细指令的编写者转变为高层目标的定义者。

风险提示:本文引用的基准测试数据来自公开评测报告及厂商官方发布,实际使用效果可能因具体应用场景而异。AI模型迭代迅速,相关性能指标仅供参考。

本文由AI辅助生成

分享到: