北京时间2026年9月4日凌晨,新一代旗舰大模型GPT‑6 Astra正式对外发布,官方将其定义为智能水平与对齐效果顶尖的AI模型。在发布前闭门沟通会上,OpenAI总裁提出观点:如今认为人类已经踏入AGI时代,已经算不上异想天开的想法,该言论迅速在开发者社群引发巨大讨论,也让GPT‑6 Astra成为整个AI行业关注的焦点。
但是大量用户在第一时间尝试体验之后发现,网页端以及API接口并不能直接找到该模型入口。按照官方发布节奏,Astra不会一次性全量开放,初期仅向安全研究机构、受信任合作组织授予访问权限,后续分批次向ChatGPT Plus、Pro、Business、Enterprise付费订阅用户逐步放开访问资格。针对已经付费但尚未拿到权限的订阅用户,官方推出补偿策略,尚未获得Astra使用权的用户会按天进行额度重置补偿,每等待一天赠送一次额度重置,以此降低灰度等待带来的体验损失。
很多人简单把本次迭代理解为对话问答效果升级,但GPT‑6 Astra最核心的革新点是Computer Use计算机自主操作能力。官方对外宣传口号为:凡是人能够在电脑上面完成的操作,Astra都可以替你完成,并且执行速度更快。过往绝大多数大模型高度依赖软件对外开放API接口,现实业务环境中大量老旧企业系统、各类桌面客户端软件,并没有对外暴露API;但几乎所有软件都会提供图形可视化界面,屏幕画面本身就可以作为通用交互载体。AI只要读懂屏幕画面,识别按钮、输入框、弹窗控件,模拟鼠标点击、键盘输入,就可以直接操控各类软件,不需要软件厂商专门做接口改造适配,这也是Computer Use能力最核心的业务价值。
阿里云部署AI Agent:OpenClaw/Hermes Agent全网最简单,只需两步,详情👉访问阿里云OpenClaw/Hermes一键部署专题页面了解。








Token Plan Token 最便宜/支持多模型切换:👉访问订阅阿里云百炼Token Plan AI大模型服务 。支持多模型切换,用于多模态模型灵活调用,实现多模型、多工具、多场景下的额度共享与统一管理,兼顾灵活性、稳定性与安全性,大幅降低企业使用大模型的门槛与成本。




一、核心基准跑分,多维度横向能力对比
各类公开基准测试可以直观反映Astra相对前代产品的能力变化,下面整理代表性测试项目,同时和上一代GPT‑5.6 Sol、竞品Claude Fable 5.1进行横向对比。
ScreenSpot‑Pro测试专门衡量AI识别屏幕画面、定位界面控件点击坐标的准确度,是计算机操作能力的底层基础。GPT‑5.6 Sol得分76.9%,GPT‑6 Astra提升至92.7%,界面元素识别准确率实现质的飞跃。
OSWorld 2.0测试把模型直接放进一套完整真实操作系统,要求AI独立完成各类现实电脑任务,高度贴近真实工作场景。Astra任务完成率达到72.6%,GPT‑5.6 Sol为65.7%;效率提升更加值得关注,同等任务GPT‑5.6 Sol平均耗时75分钟,Astra平均仅需要40分钟,任务耗时几乎减半。
Terminal‑Bench 4.0用来考核AI在终端环境完成软件开发、系统配置、数据分析、脚本编写等复杂命令行任务。GPT‑6 Astra拿到57.9%分数,GPT‑5.6 Sol仅37.3%,Claude Fable 5.1取得55.8%,可以看出在终端工程任务维度Astra小幅领先竞品。
ARC‑AGI‑3测试集不提供任务说明,模型需要不断试错,自行摸索关卡背后隐藏规则,并且把学到规律迁移到更加复杂关卡,考察模型自主悟性与抽象归纳能力。测试刚推出时全球顶尖模型得分仅0.51,人类平均水平48分,GPT‑5.6 Sol仅有7.8分,而GPT‑6 Astra在特定运行模式下得分高达99.9分,几乎接近满分。
FrontierMath Tier4高难度数学测试,针对科研级高阶数理题目,Astra准确率达到97.6%,在高阶数理推理领域取得巨大进步。
定价层面,API模型固定ID为gpt‑6‑astra,计费标准输入每百万token 10美元,输出每百万token 50美元,价格约为GPT‑5.6 Sol的2.5倍,和Claude Fable5.1处于同一价位区间。虽然单Token单价更高,得益于任务完成效率提升,部分复杂端到端任务的整体实际开销并不会同比例上涨;ChatGPT订阅套餐用户不需要单独按Token计费,直接消耗订阅额度,叠加官方赠送的额度重置,实际使用成本感知会更低。
值得注意:第三方评测机构Artificial Analysis放出独立测评,综合智能指数维度Astra得到61分,和GPT‑5.6 Sol基本持平,甚至低于Claude Fable5.1的66分;单任务平均成本Astra达到1.67美元,GPT‑5.6 Sol仅0.94美元。这一结果说明Astra的优势集中在屏幕理解、电脑自动化操作、终端工程、陌生环境试错推理这类专项赛道;在通用常识、开放式写作等传统任务,相比前代提升幅度有限,并不是所有任务维度实现全方位碾压。同时行业存在一个周期性现象,新版本刚发布初期体验惊艳,后续厂商为控制算力成本会进行参数调优,用户感知能力发生波动,Astra后续长期实际表现还需要更大规模真实业务验证。
二、官方与内测开发者真实实战Demo案例
跑分只能反映测试集表现,官方放出大量真实业务案例,可以直观感受模型落地能力。详情👉访问阿里云百炼大模型服务平台页面 了解。


硬件电子工程场景,仅提供一张电子原理图,Astra直接打开KiCad电路设计软件,自主完成PCB电路板布局,元器件摆放、铜箔走线全部由AI独立完成,这类工作原本需要硬件工程师手动拖拽操作,耗费大量工时。
三维创作领域,Astra可以程序化大规模生成城市场景,楼房、道路、绿化、交通车辆全部自动生成;在Blender软件中完成房屋建模,导入虚幻引擎5生成可以自由漫游的室内实景,设计师可以在项目动工前沉浸式浏览空间效果。
游戏开发放出两套可交互Demo。第一套是Three.js沙滩卡丁车竞速游戏,赛道、场景资源全部代码程序化生成,并非现成素材拼接,游戏仪表盘、漂移计量、小地图、圈数名次逻辑完整,光影水面效果完成度高,达到普通外包开发产出水准。第二套宇宙飞船生成工具,给定随机种子,批量生成上千艘结构互不重复飞船,每一艘飞船由上百个模块化零件拼装,附带尺寸、载货、推力完整参数,支持导出图鉴文件。
拿到内测资格的开发者也产出大量有意思的测试结果。开发者Matt Shumer使用Astra在虚幻引擎搭建虚拟世界,生成大量具备交互逻辑的AI虚拟角色,角色之间会自发开启对话、推进剧情,沉浸感很强。还有一名拥有三十五年从业经验的免疫学教授,仅给出一句简单指令“生成一份5分钟讲解T细胞的教学视频”,Astra独立完成脚本撰写、插图生成、配音叙事,组装完整教学视频,教授评价产出质量不输自己多年积累课件。
同时官方开发者展示馆公开大量Codex项目,完整公开原始提示词以及每一轮迭代修改记录,对提示工程学习具备很高参考价值,其中两类提示词设计思路值得借鉴。
第一种,AI自我验收测试Loop Engineering思路,代码任务结尾增加自我校验指令示例:
Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors.
含义:执行项目构建、代码检查,多次在浏览器运行游戏,校验碰撞、计分、失败、重启逻辑,确保控制台无报错。也就是AI写完代码之后,让AI自行完成测试修复BUG,而不是全部等待人工排查。
第二种,先确认视觉概念,再编写业务代码。大型交互项目,先通过文生图产出多张玩法概念草图,敲定视觉风格、页面布局,确认视觉方案之后,再编写业务代码。很多AI生成前端页面简陋土气,这套流程可以显著改善成品视觉效果。
三、API调用实操,curl、Python完整可运行代码
账号已经拿到Astra访问权限之后,可以通过Responses API完成调用,下面提供curl、Python SDK两份可直接修改运行示例。
Linux/macOS设置环境变量,不要硬编码密钥写入代码:
export OPENAI_API_KEY="sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxx"
# 校验环境变量
echo ${OPENAI_API_KEY:0:12}******
curl调用示例:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content‑Type: application/json" \
-d '{
"model":"gpt‑6‑astra",
"input":"打开电脑记事本,写一段关于AI自主操作软件的简短介绍,保存到桌面",
"tools":[{"type":"computer_use"}]
}'
Python SDK调用,先安装依赖包:
pip install openai
完整Python示例:
import os
from openai import OpenAI
# 从环境变量读取密钥,禁止硬编码写入源码
client = OpenAI(api_key=os.getenv("OPENAI_API_KEY"))
def astra_task_demo(user_input: str):
resp = client.responses.create(
model="gpt‑6‑astra",
input=user_input,
reasoning={
"effort":"high"
},
tools=[
{
"type":"code_interpreter"}
]
)
return resp.output_text
if __name__ == "__main__":
res = astra_task_demo("规划一份简单前端网页项目,输出项目目录结构与核心HTML代码")
print(res)
重要校验提示:如果使用第三方中转代理服务调用gpt‑6‑astra,务必校验返回报文内部model字段,确认实际运行模型为
gpt‑6‑astra,防止网关静默映射到老版本模型,出现调用名称和实际执行模型不一致的情况。
四、上手使用关键注意事项
- 权限分批灰度开放:发布初期普通账号看不到gpt‑6‑astra属于正常现象,等待官方分批次推送。不要轻信非官方渠道倒卖Astra访问权限账号,存在账号被盗、接口被篡改等安全风险。
- 做好成本管控:API单价较高,开启Computer Use计算机操作工具之后Token消耗速度极快,业务调用务必设置额度上限,规避脚本异常循环调用带来高额账单。
- Computer Use安全风险:开启电脑操作工具之后,模型具备操作本地文件、点击软件界面的能力。测试阶段不要直接在存放重要业务资料的主力设备执行高危操作,优先使用隔离虚拟机环境开展测试。
- 合理选型,区分专项能力与通用能力:工程自动化、屏幕操作、终端脚本、陌生环境探索类任务优先选择Astra;普通文案改写、简单问答场景,前代模型已经可以很好完成,不必一味追求新版本。
- 中转接口结果校验:使用第三方中转代理,务必校验response报文model字段,确认实际运行的目标模型。
- 理性看待AGI概念:总裁提出的AGI相关表述属于个人前瞻性判断,行业对于AGI本身还没有形成统一公认严格定义。Astra在数字化虚拟电脑环境能力飞跃,但现实物理世界感知、长期自主目标规划、真实世界常识推理依旧存在短板,它更偏向强大的数字世界自动化助手,并非无所不能的通用超级智能。
五、国内Agent落地参考:OpenClaw与Hermes云端部署方案
想要体验类似Computer Use的Agent自动化能力,国内开发者可以使用OpenClaw、Hermes Agent两套框架,可以基于轻量应用服务器快速部署,实现7×24小时不间断运行,不用本地电脑一直开机。
两者定位存在明确区分:
- OpenClaw:适合日常办公消息处理、消息提醒、简单查询,上手门槛低,对接主流办公IM,适合第一次接触AI Agent的用户;
- Hermes Agent:面向深度研究型复杂任务,擅长多步骤长链条任务、网页复杂内容抓取,适合复杂项目、多环节配合的工作流。
轻量服务器部署核心Shell操作示例
实例创建完成后SSH登录服务器,基础防火墙配置命令:
# 更新系统软件包
yum update -y
# 放行OpenClaw核心服务端口
firewall‑cmd --add‑port=1878/tcp --permanent
firewall‑cmd --add‑port=18789/tcp --permanent
firewall‑cmd --reload
# 查看端口放行状态
firewall‑cmd --list‑ports
查看服务运行状态:
systemctl status openclaw‑agent
systemctl status hermes‑agent
国内部署Agent框架之后,可以对接百炼Token Plan订阅计划,多模型灵活切换,统一Credits额度管理,适配文本、图像等多模态任务,降低AI Agent业务落地的成本。Token Plan分为标准版、高级版、尊享版三档,支持兼容大量AI开发工具,获取专属API‑Key之后填入Agent配置文件,即可完成对接。
简单读取Token Plan密钥环境变量,Agent配置脚本片段:
export TOKEN_PLAN_API_KEY="sk‑sp‑xxxxxxxxxxxxxxxxxxxxxxxxxxxx"
export TOKEN_PLAN_BASE_URL="https://token‑plan.cn‑beijing.maas.aliyuncs.com/compatible‑mode/v1"
六、总结
GPT‑6 Astra最大的进化,不再局限传统对话文本生成,而是实现看懂屏幕画面、操控软件完成真实电脑工作的Computer Use计算机操作能力。在ScreenSpot‑Pro、OSWorld2.0、Terminal‑Bench4.0、ARC‑AGI‑3多项专项基准测试取得跨越式提升,官方放出电路设计、三维建模、游戏开发大量惊艳Demo。详情👉访问阿里云百炼大模型服务平台页面 了解。


但是第三方综合评测提醒开发者,不要被营销概念裹挟。专项跑分表现亮眼,不等于全方位AGI已经落地,它在通用写作、开放式综合任务上相比前代提升有限。官方“欢迎来到AGI时代”属于前瞻性展望,并非已经完全落地的既定事实。
对于开发者,Astra带来最大启发:大量没有对外API接口的传统软件系统,现在可以依靠屏幕理解实现自动化,极大拓宽Agent应用想象空间。同时要重视权限灰度、成本、安全风险,高危操作务必放在隔离测试环境。
国内开发者如果想要体验同类自主Agent自动化能力,可以部署OpenClaw、Hermes Agent,依托云端实例实现全天候运行,搭配Token Plan订阅方案,完成多模型统一额度管控,构建适配国内业务环境的自动化智能体。后续随着更多用户拿到Astra访问权限,大量真实业务案例会持续涌现,也会进一步看清这款旗舰模型完整的能力边界。