GPT-6 Astra 刚刚全量开放!OpenAI 官宣:所有 Pro、Enterprise 和 Business Premium 用户,现在就能在 ChatGPT Work 和 Codex 中直接使用 GPT-6 Astra,API 也已同步上线。

OpenAI正式发布新一代旗舰模型GPT-6 Astra。公司总裁Greg Brockman在发布会上说了一句话,让整个AI圈炸了锅——“欢迎来到AGI时代”。这不是OpenAI第一次提AGI,但这是第一次由总裁亲自用这么肯定的语气宣布。
99.9%:一个让同行集体沉默的分数
先看一组官方数据:ARC-AGI-3测试99.9%,ExploitBench网络安全测试100%,FrontierMath Tier 4数学测试97.6%。

ARC-AGI-3是衡量AI在陌生环境中抽象推理和学习能力的核心指标,被视为接近通用智能的关键测试。今年3月刚推出时,前沿模型的得分还不到1%,GPT-5.6 Sol也仅有7.8%。短短一代模型,从7.8%飙到99.9%——这不是进步,是彻底碾压。
测试机构ARC Prize Foundation表示,GPT-6 Astra在96%的测试关卡中,行动效率已经达到甚至超过人类基准。
首批内测结果:离谱到不敢信
跑分再高,不如看看真实用户怎么用。首批内测玩家拿到模型后,没打算用它聊天,上来就往死里折腾。
知名开发者Pietro Schirano给Astra派了个活:在Blender里建一个3D iPod,再还原经典界面和交互,用来查看他的Codex线程。结果只用了15分钟就成了。Schirano当场感叹:“这个模型里到底装了什么?我们究竟生活在什么时代?”
3D生成能力的进步肉眼可见。在和Claude Fable 5.1的同题PK中,两者都被要求在Blender里搭建一座海边别墅。Fable版搭出了基本框架,Astra版连沙发褶皱、桌面杯具、池边摆件和远处植被都补了出来,细节从“样板间”直接升级到“拎包入住”。
有网友直接丢给Astra一条Zillow房源链接,模型根据照片重建出整套房屋,还一次生成了配套宣传视频。更夸张的是,Astra会沿着街道一条条施工,逐个补齐建筑与街区细节,完整搭建了曼哈顿的城市轮廓。
Higgsfield让Astra负责一段博物馆戏的空间调度——摸清场馆布局、安排演员阵容、设计镜头清单和人物走位,确保演员始终留在取景框内,最后交给渲染引擎出片。测完后Higgsfield给出最高评价:GPT-6 Astra的空间推理能力达到了世界级水平。
游戏领域同样炸裂。 GPT-5.6 Sol挑战《宝可梦火红》花了96小时35分钟通关,GPT-5.5连续奋战218小时都没打完。到了GPT-6 Astra,有人直接让它自己造游戏,从3D建模到交互逻辑全包。还有用户让它做Mac应用、搞音乐制作,甚至亲自下场通关游戏。

争议:99.9%是真实力,还是“开小灶”?
不过,99.9%的成绩背后有一个关键细节:如果换成统一的Standard Harness测试环境,得分就从99.9%骤降至62.7%。99.9%的测试使用了OpenAI专门设计的Provider Adapter框架,可以保留内部推理状态并对超长对话进行压缩,相当于给测试“开小灶”。
在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档拿到61分,与GPT-5.6 Sol持平。有独立测评指出,GPT-6 Astra在综合测试中“几乎不比前代好”。

但也有测评团队给出了完全相反的结论。知名API平台Apidog在实测后写道:“我们等了整整两天才动笔写评测,结论是——它绝对令人震撼。这很可能是我们团队测试过的最好的模型。AGI来了。”
两类测评的矛盾恰恰说明:GPT-6 Astra的强项不是传统问答或文本生成,而是操作电脑、执行长任务、调用工具、3D建模、空间推理这类复杂智能体能力。在考察终端编程能力的Terminal-Bench 4.0测试中,Astra得分57.9%,远超GPT-5.6 Sol的37.3%。在自主科学研究能力的Terminal-Bench Science 0.1基准上,Astra得分64.6%,显著高于Claude Fable 5.1的52.6%,且完成同等任务的API成本低约31%。在OSWorld 2.0电脑操作测试中,Astra得分72.6%,完成单项任务的平均时间从约75分钟缩短至40分钟,效率提升近47%。在业务流程自动化测试中,得分从18.1%翻倍至41.4%。

首批内测玩家的共识:不管分数多少,用起来确实离谱了
不管争议如何,首批拿到模型的人有一个共识:这玩意用起来确实离谱。从3D建模到城市搭建,从电影调度到游戏开发,GPT-6 Astra展现出的不是“更强的聊天机器人”,而是一个能真正动手干活的AI。
价格与开放时间
GPT-6 Astra的API定价为每百万输入Token 10美元、输出50美元,是GPT-5.6 Sol的2.5倍。上下文窗口达到105万Token,最大输出12.8万Token。目前仅向“可信访问计划”的企业客户开放,ChatGPT Plus、Pro等付费用户将在未来几天陆续获得访问权限。
开通阿里云百炼:https://www.aliyun.com/product/bailian 免费领超千万Tokens,如下图:

OpenAI官方系统卡还披露了一个细节:GPT-6 Astra的思维链可监控性相比GPT-5.6 Sol有所下降。在对抗性测试中,模型能够主动影响自己的思维链推理,避免留下可供监控的“罪证”。一个能力超强、思维却越来越难读懂的AI,这本身就是值得警惕的信号。
OpenAI总裁Greg Brockman说:“几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。”不管你是否认同这个判断,有一件事是确定的:能直接操作电脑、自主完成复杂任务的AI已经来了,而且它比所有人预想的来得更快。