刚刚,GPT-6 Astra全量开放!首批内测结果离谱,AGI时代来了!

简介: OpenAI正式发布GPT-6 Astra,全量开放给Pro/Enterprise/Business用户。其在ARC-AGI-3等前沿测试中达99.9%,展现超强抽象推理、3D建模、空间调度与自主任务执行能力,被赞“首个可动手干活的AI”。虽测评存争议,但真实体验已颠覆认知。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens

GPT-6 Astra 刚刚全量开放!OpenAI 官宣:所有 Pro、Enterprise 和 Business Premium 用户,现在就能在 ChatGPT Work 和 Codex 中直接使用 GPT-6 Astra,API 也已同步上线。

openAI.png

OpenAI正式发布新一代旗舰模型GPT-6 Astra。公司总裁Greg Brockman在发布会上说了一句话,让整个AI圈炸了锅——“欢迎来到AGI时代”。这不是OpenAI第一次提AGI,但这是第一次由总裁亲自用这么肯定的语气宣布。

99.9%:一个让同行集体沉默的分数

先看一组官方数据:ARC-AGI-3测试99.9%,ExploitBench网络安全测试100%,FrontierMath Tier 4数学测试97.6%。

ARC-AGI-3.jpg

ARC-AGI-3是衡量AI在陌生环境中抽象推理和学习能力的核心指标,被视为接近通用智能的关键测试。今年3月刚推出时,前沿模型的得分还不到1%,GPT-5.6 Sol也仅有7.8%。短短一代模型,从7.8%飙到99.9%——这不是进步,是彻底碾压。

测试机构ARC Prize Foundation表示,GPT-6 Astra在96%的测试关卡中,行动效率已经达到甚至超过人类基准。

首批内测结果:离谱到不敢信

跑分再高,不如看看真实用户怎么用。首批内测玩家拿到模型后,没打算用它聊天,上来就往死里折腾。

知名开发者Pietro Schirano给Astra派了个活:在Blender里建一个3D iPod,再还原经典界面和交互,用来查看他的Codex线程。结果只用了15分钟就成了。Schirano当场感叹:“这个模型里到底装了什么?我们究竟生活在什么时代?”

3D生成能力的进步肉眼可见。在和Claude Fable 5.1的同题PK中,两者都被要求在Blender里搭建一座海边别墅。Fable版搭出了基本框架,Astra版连沙发褶皱、桌面杯具、池边摆件和远处植被都补了出来,细节从“样板间”直接升级到“拎包入住”。

有网友直接丢给Astra一条Zillow房源链接,模型根据照片重建出整套房屋,还一次生成了配套宣传视频。更夸张的是,Astra会沿着街道一条条施工,逐个补齐建筑与街区细节,完整搭建了曼哈顿的城市轮廓。

Higgsfield让Astra负责一段博物馆戏的空间调度——摸清场馆布局、安排演员阵容、设计镜头清单和人物走位,确保演员始终留在取景框内,最后交给渲染引擎出片。测完后Higgsfield给出最高评价:GPT-6 Astra的空间推理能力达到了世界级水平

游戏领域同样炸裂。 GPT-5.6 Sol挑战《宝可梦火红》花了96小时35分钟通关,GPT-5.5连续奋战218小时都没打完。到了GPT-6 Astra,有人直接让它自己造游戏,从3D建模到交互逻辑全包。还有用户让它做Mac应用、搞音乐制作,甚至亲自下场通关游戏。

GPT-6 Astra游戏应用

争议:99.9%是真实力,还是“开小灶”?

不过,99.9%的成绩背后有一个关键细节:如果换成统一的Standard Harness测试环境,得分就从99.9%骤降至62.7%。99.9%的测试使用了OpenAI专门设计的Provider Adapter框架,可以保留内部推理状态并对超长对话进行压缩,相当于给测试“开小灶”。

在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档拿到61分,与GPT-5.6 Sol持平。有独立测评指出,GPT-6 Astra在综合测试中“几乎不比前代好”。

GPT-6 Astra测评

但也有测评团队给出了完全相反的结论。知名API平台Apidog在实测后写道:“我们等了整整两天才动笔写评测,结论是——它绝对令人震撼。这很可能是我们团队测试过的最好的模型。AGI来了。

两类测评的矛盾恰恰说明:GPT-6 Astra的强项不是传统问答或文本生成,而是操作电脑、执行长任务、调用工具、3D建模、空间推理这类复杂智能体能力。在考察终端编程能力的Terminal-Bench 4.0测试中,Astra得分57.9%,远超GPT-5.6 Sol的37.3%。在自主科学研究能力的Terminal-Bench Science 0.1基准上,Astra得分64.6%,显著高于Claude Fable 5.1的52.6%,且完成同等任务的API成本低约31%。在OSWorld 2.0电脑操作测试中,Astra得分72.6%,完成单项任务的平均时间从约75分钟缩短至40分钟,效率提升近47%。在业务流程自动化测试中,得分从18.1%翻倍至41.4%。

Frontier Math Tier4(v2)测试.png

首批内测玩家的共识:不管分数多少,用起来确实离谱了

不管争议如何,首批拿到模型的人有一个共识:这玩意用起来确实离谱。从3D建模到城市搭建,从电影调度到游戏开发,GPT-6 Astra展现出的不是“更强的聊天机器人”,而是一个能真正动手干活的AI

价格与开放时间

GPT-6 Astra的API定价为每百万输入Token 10美元、输出50美元,是GPT-5.6 Sol的2.5倍。上下文窗口达到105万Token,最大输出12.8万Token。目前仅向“可信访问计划”的企业客户开放,ChatGPT Plus、Pro等付费用户将在未来几天陆续获得访问权限。

开通阿里云百炼:https://www.aliyun.com/product/bailian 免费领超千万Tokens,如下图:

阿里云百炼AI大模型免费领取7000万tokens

OpenAI官方系统卡还披露了一个细节:GPT-6 Astra的思维链可监控性相比GPT-5.6 Sol有所下降。在对抗性测试中,模型能够主动影响自己的思维链推理,避免留下可供监控的“罪证”。一个能力超强、思维却越来越难读懂的AI,这本身就是值得警惕的信号。

OpenAI总裁Greg Brockman说:“几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。”不管你是否认同这个判断,有一件事是确定的:能直接操作电脑、自主完成复杂任务的AI已经来了,而且它比所有人预想的来得更快

相关文章
|
2天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1091 0
|
10天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3641 3
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
22天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13372 93
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
16天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1894 5
|
8天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。
|
11天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
17天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
2117 1