北京时间2026年9月4日凌晨,OpenAI对外推出新一代旗舰大模型GPT‑6 Astra,官方将它定义为全世界智能水平最高、对齐效果最好的AI模型。在发布前的媒体闭门沟通会上,OpenAI总裁Greg Brockman抛出一句引发整个行业热烈讨论的观点:如今认为人类已经踏入AGI时代,已经算不上是异想天开的想法,欢迎大家来到AGI时代。这句话迅速传遍开发者圈子,也让GPT‑6 Astra成为全球AI领域焦点。
但不少第一时间想要体验新模型的用户打开客户端之后发现,不管是网页对话界面还是API接口,都找不到GPT‑6 Astra的入口。按照官方公布的推送节奏,Astra初期仅向一小批安全研究机构、受信任的合作组织开放访问权限,普通付费订阅用户无法直接使用。在之后数天内,才会分批次向ChatGPT Plus、Pro、Business以及Enterprise订阅用户逐步放开权限。
针对付费用户暂时拿不到模型权限这件事,ChatGPT产品负责人也对外说明补偿策略:凡是已经订阅付费套餐却还未获得Astra访问资格的用户,平台会按天进行额度重置补偿,每等待一天就赠送一次额度重置,尽可能降低用户等待带来的体验损失。
很多人会把这一代模型的进步简单理解为对话聊天能力更强,实际上GPT‑6 Astra最大的迭代重点,是计算机自主操作能力(Computer Use)。OpenAI对外宣传的核心口号为:凡是人能够在电脑上面完成的操作,Astra都可以替你完成,并且执行速度更快。过去绝大多数AI模型高度依赖各类软件开放API接口,现实世界里大量企业内部老旧系统、各类桌面软件根本没有对外API,文档资料也残缺不全。而所有软件都具备图形交互界面,屏幕画面本身就成为通用的交互入口,AI只需要看懂屏幕画面,识别按钮、输入框、弹窗,模拟鼠标点击、键盘输入,就可以直接操作各类软件,不需要软件厂商专门做适配改造,这也是Computer Use能力巨大的价值所在。
阿里云部署AI Agent:OpenClaw/Hermes Agent全网最简单,只需两步,详情👉访问阿里云OpenClaw/Hermes一键部署专题页面了解。








Token Plan Token 最便宜/支持多模型切换:👉访问订阅阿里云百炼Token Plan AI大模型服务 。支持多模型切换,用于多模态模型灵活调用,实现多模型、多工具、多场景下的额度共享与统一管理,兼顾灵活性、稳定性与安全性,大幅降低企业使用大模型的门槛与成本。



核心基准跑分数据,多维度能力对比
各类公开基准测试可以直观看到Astra相对前代模型的提升幅度,下面梳理几项代表性测试项目,同时对比上一代GPT‑5.6 Sol以及竞品Claude Fable 5.1的成绩。
ScreenSpot‑Pro测试专门衡量AI看懂屏幕画面、精准定位界面元素点击坐标的能力,该测试是电脑操作能力的基础。上一代GPT‑5.6 Sol得分76.9%,GPT‑6 Astra直接提升至92.7%,识别界面控件的准确率得到质的飞跃。
OSWorld 2.0测试会直接把AI扔进一台完整真实操作系统当中,让AI独立完成一系列复杂真实电脑任务,非常贴近现实工作场景。Astra任务完成率达到72.6%,对比GPT‑5.6 Sol的65.7%实现明显上涨。更值得注意的是执行效率:同样一套任务,GPT‑5.6 Sol平均需要75分钟才能做完,而Astra平均耗时仅40分钟,完成任务耗时几乎减半。
Terminal‑Bench 4.0用来考核AI在终端环境完成软件开发、系统配置、数据分析、脚本编写等复杂命令行任务。GPT‑6 Astra拿到57.9%分数,GPT‑5.6 Sol仅37.3%,Claude Fable 5.1为55.8%,可以看到在终端工程任务上Astra已经小幅领先竞品。
最令人震惊的是ARC‑AGI‑3测试集,这项测试不提供任务说明书,不会告诉AI规则与目标,模型需要不断试错,自己摸索关卡背后隐藏规律,再把学到的规律迁移到更加复杂关卡,考察的是模型的自主悟性与抽象归纳能力。该测试发布之初,全球最强AI模型得分仅0.51分,人类平均水平48分,GPT‑5.6 Sol只有7.8分,而GPT‑6 Astra直接拿到99.9分,几乎接近满分水平。
数学能力测试FrontierMath Tier4,这套是高难度研究级数学题目,Astra准确率达到97.6%,基本将该测试集打穿,在高阶数理推理能力上实现巨大进步。
在价格层面,API模型ID固定为gpt‑6‑astra,计费标准为每百万输入token 10美元,每百万输出token 50美元,价格水平与Claude Fable5.1处于同一档位,是前代GPT‑5.6 Sol的2.5倍。虽然单价更高,但得益于任务完成效率提升,部分复杂任务整体实际开销未必会大幅上涨;对于ChatGPT订阅套餐用户,不需要单独按token计费,依靠订阅额度使用,再叠加官方赠送的额度重置,实际使用成本感受会低很多。
API调用实操示例代码
当账号已经拿到GPT‑6 Astra访问权限之后,可以通过官方Responses API完成调用,下面给出curl以及Python SDK两份可直接修改使用的示例代码。
curl调用示例,替换环境变量内的API密钥即可发起请求:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content‑Type: application/json" \
-d '{
"model":"gpt‑6‑astra",
"input":"打开电脑上的记事本,写一段关于AI自主操作软件的简短介绍,保存到桌面",
"tools":[{"type":"computer_use"}]
}'
Python SDK调用示例,需要提前安装openai依赖包:
# 安装SDK:pip install openai
import os
from openai import OpenAI
# 从环境变量读取密钥,不要硬编码写在代码文件内
client = OpenAI(api_key=os.getenv("OPENAI_API_KEY"))
resp = client.responses.create(
model="gpt‑6‑astra",
input="帮我规划一份简单的前端网页项目,输出项目目录结构与核心html代码",
reasoning={
"effort":"high"},
tools=[{
"type":"code_interpreter"}]
)
print(resp.output_text)
注意:如果中转服务宣称支持gpt‑6‑astra,建议做校验,看返回报文内model字段是否为
gpt‑6‑astra,避免接口内部被静默映射为旧版本模型,造成实际使用的并不是目标模型。
官方与内测开发者实战案例展示
跑分数据只能代表测试集效果,官方放出大量真实业务案例,能够更加直观感受模型实际落地能力。
硬件电子工程案例:让Astra直接打开KiCad电路设计软件,只提供一张电子原理图,模型自主完成PCB电路板布局。元器件摆放位置、铜箔走线全部由AI独立完成,而这类工作在现实当中是硬件工程师需要手动拖拽操作,耗时漫长的工作环节。
三维创作领域,Astra可以完整生成大规模城市场景,楼房、道路、绿化带、交通车辆全部程序化生成。还可以在Blender中完成房屋建模,再导入虚幻引擎5,生成可以自由漫游的室内实景,设计师可以在项目动工之前就沉浸式浏览完整空间效果。
游戏开发方面,官方嵌入两个可交互网页游戏Demo。第一个是Three.js编写的沙滩卡丁车竞速游戏,赛道、场景资源全部由代码程序化生成,不是现成素材拼接。游戏内部速度仪表盘、漂移计量条、小地图、名次圈数逻辑全部完备,画面光影、水面效果完成度很高,已经可以媲美不少外包开发产出。
第二个是宇宙飞船生成工具,给定随机种子,就可以批量生成上千艘结构互不重复的飞船,每一艘飞船都由上百个模块化零件拼装,同时附带尺寸、载货能力、推力等完整参数,支持导出图鉴文件。
不少拿到内测资格的开发者也分享出很多有意思的测试结果。开发者Matt Shumer,使用Astra在虚幻引擎构建虚拟世界,生成大量AI驱动虚拟角色,设定角色需要互相协作才能生存。在运行过程中,虚拟角色会自主开启对话交互,角色之间自发沟通剧情,带来很强的沉浸效果。
还有一位拥有三十五年研究经验的免疫学教授,仅仅给出一句简单指令:生成一份5分钟讲解T细胞的教学视频。Astra独立完成整体脚本框架、生成配套插图画面,自动规划配音叙事,完整组装出整套教学内容。教授评价,这份产出质量,甚至不输自己多年教学积累产出的课件。
OpenAI开发者展示馆当中,收录大量Codex项目,并且公开全部原始提示词以及每一轮迭代修改记录,对于学习AI提示工程很有参考价值。其中有两条非常值得借鉴的提示词设计思路。
第一条,强制AI自我验收测试。例如3D堆叠玻璃塔游戏的提示词末尾加入要求:
Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors.
翻译含义:执行项目构建与代码检查,在浏览器多次运行游戏,验证碰撞逻辑、计分逻辑、失败处理、重启功能,保证控制台不存在报错。这就是Loop Engineering思想,AI写完代码之后让AI自己完成测试,发现问题自行修复,而不是全部等待人工排查BUG。
第二条,先做视觉概念,再编写代码。部分大型交互项目提示词要求模型,先用文生图产出多张玩法概念草图,把整体视觉风格、界面布局敲定,确认视觉方案之后,再动手写业务代码。很多人用AI生成前端页面效果简陋土气,这套流程可以明显改善最终成品的视觉质感。
理性思考:AGI时代真的已经到来吗
虽然官方宣传声势浩大,不少第三方评测机构给出不一样的结论。第三方机构Artificial Analysis在模型发布当日就放出独立评测报告,综合智能指数维度,GPT‑6 Astra拿到61分,这个分数和上一代GPT‑5.6 Sol几乎持平,甚至比Claude Fable5.1还要低5分。同时完成单任务的平均成本Astra达到1.67美元,GPT‑5.6 Sol仅0.94美元,也就是综合智能没有明显提升,但是使用成本大幅上涨。
这个现象背后的原因很关键:Astra的优势集中在屏幕理解、电脑自动化操作、终端工程任务、陌生环境试错推理这一类专项能力;而在第三方综合评测选用的大量通用常识、开放式写作类题目当中,它相对前代模型提升幅度有限。也就是说,它并不是在所有任务维度实现全面碾压,而是在Agent、计算机操作这类特定赛道实现跨越式升级。
同时行业用户也普遍观察到大模型的一种周期性现象:新版本刚发布的最初一周体验惊艳,仿佛智力水平大幅跃升;之后厂商为了控制算力成本,会做参数调整,用户会感知到模型能力下滑;大量用户反馈之后,官方再次调回性能;过一段时间又会推出小迭代版本,循环往复。Astra未来是否会出现类似现象,还需要更长时间大规模真实用户使用之后才能够确认。
我们需要厘清一个关键点:总裁的发言属于个人判断,并不代表行业已经形成共识,目前整个AI行业对于AGI本身都还没有统一、公认的严格定义。ARC‑AGI‑3拿到接近满分,代表模型的陌生环境推理能力取得巨大突破;OSWorld跑分提升,代表自主执行复杂多步骤任务能力变强。但是,距离完全通用、可以自主闭环完成现实世界绝大多数目标的通用人工智能,依旧存在明显差距。
它擅长在已经数字化的电脑虚拟环境中完成操作,但现实物理世界感知、真实世界常识、长期持续自主目标规划、自我迭代改进等方面依旧存在短板。Astra更像是一台强大的数字世界自动化助手,而不是已经无所不能的通用超级智能。
阿里云部署AI Agent:OpenClaw/Hermes Agent全网最简单,只需两步,详情👉访问阿里云OpenClaw/Hermes一键部署专题页面了解。








Token Plan Token 最便宜/支持多模型切换:👉访问订阅阿里云百炼Token Plan AI大模型服务 。支持多模型切换,用于多模态模型灵活调用,实现多模型、多工具、多场景下的额度共享与统一管理,兼顾灵活性、稳定性与安全性,大幅降低企业使用大模型的门槛与成本。



上手使用的注意事项
- 权限分批开放:刚发布阶段普通账号看不到gpt‑6‑astra模型选项属于正常现象,等待平台分批推送,不要轻信非官方渠道倒卖的所谓Astra权限账号,存在账号被盗、接口被篡改风险。
- 成本管控:API单价较高,复杂computer_use任务token消耗速度快,建议设置调用额度上限,避免意外产生高额账单。
- Computer Use风险:开启电脑操作工具之后,模型可以操作文件、点击软件界面,测试阶段尽量不要在存放重要资料的主力设备上直接执行高危操作,优先使用虚拟机环境做测试。
- 区分专项能力与通用能力:遇到工程自动化、屏幕操作、终端脚本任务优先选用Astra;普通文案、简单问答场景,前代模型就足够完成,不必一味追求新模型。
- 校验接口真实性:使用第三方中转接口调用,务必校验response报文model字段,确认实际运行模型。
总结
GPT‑6 Astra最大的革新点,不再局限于对话问答、文本生成,而是AI从“只会输出文字”进化到“可以看懂屏幕、操控软件完成真实工作”。在屏幕识别、终端工程、陌生环境试错推理多项基准测试上面实现跨越式提升,官方给出大量电路设计、三维建模、游戏开发的惊艳Demo。
但同时第三方综合评测又提醒我们,不能被营销概念裹挟,专项跑分强不等于全方位的AGI降临。官方所说的“欢迎来到AGI时代”更像是对技术跃迁的美好展望,而不是已经完全落地的既定事实。对于开发者来说,Astra带来最大机会,是大量没有API的传统软件,现在有机会通过AI屏幕理解能力实现自动化,Agent应用的想象空间被进一步打开。后续随着大规模用户拿到权限,会涌现出更多真实场景的实践案例,也会更加全面看清这款新模型能力边界。