刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!

简介: OpenAI 正式推出 GPT-6 Astra 模型,带大家看看这次 GPT 有哪些提升,跟 Claude Fable 5.1 有什么差距?AI 编程能力如何?AGI 真的来了么?

大家好,我是程序员鱼皮。

时间过得真快啊,距离 GPT-5 发布竟然已经过去一年多了。

昨天凌晨 3 点多,OpenAI 终于把 GPT-6 Astra 放出来了!

官方把它叫做「全世界最智能、也最对齐的模型」。而 OpenAI 总裁 Greg Brockman 在发布前的媒体闭门会上,最后说了这么一句话。

现在觉得我们已经进入 AGI 时代,并不算什么不合理的想法,欢迎来到 AGI 时代。

我本来是想第一时间跑一轮实测的,案例都准备好了。结果打开 ChatGPT 翻了一圈模型列表,没有;去看 API,也没有……

去官方博客看了一下,目前 Astra 只开放给一小批安全厂商,普通订阅用户是用不了的,接下来几天才会陆续开给 ChatGPT 的 Plus、Pro、Business 和 Enterprise 用户。

吊大家的胃口嘛这不是?

OpenAI 自己也知道这件事说不过去,于是负责 ChatGPT 的 Tibo 发了一条推特,说会给每一个订阅了付费计划但还没拿到 Astra 权限的用户,按天补偿额度重置,一天没用上就补一次。

行行行,原谅你了(正好周五我可以摸鱼了~

GPT-6 Astra 强在哪

这次,OpenAI 官方推文并没有吹 GPT-6 的编程能力,而是操作电脑能力。

他们把 GPT-6 Astra 称为「全世界最强的电脑操作模型」,AI 可以像人一样看屏幕、点按钮、填表单、刷应用,无所不能。

先看看跑分,有个叫 ScreenSpot-Pro 的测试专门考模型能不能看懂屏幕、并且精准点到该点的位置,上一代 GPT-5.6 Sol 是 76.9%,Astra 直接干到了 92.7%。

ScreenSpot-Pro 跑分

还有一个更接近真实工作的测试叫 OSWorld,就是把 AI 扔进一台真电脑里让它自己干活。Astra 的完成率是 72.6%,比 Sol 的 65.7% 高了不少。更关键的是完成同样的任务,Sol 平均要 75 分钟,Astra 只要 40 分钟!

OSWorld 跑分

我觉得主攻「屏幕理解」是个正确的方向。现实里绝大多数软件根本没有 API,很多公司的内部系统还是二十年前写的,文档都不知道在哪。但所有软件都有界面,那界面本身就是最通用的 API,AI 不用等谁来适配,自己看屏幕操作就完了。

GPT-6 Astra 的编程能力也有大幅提升。Terminal-Bench 4.0 考的是在终端里完成软件开发、系统配置和数据分析这类复杂任务,Astra 拿到 57.9%,Sol 只有 37.3%,Claude Fable 5.1 是 55.8%。

Terminal-Bench 4.0 跑分

不过这次最让我意外的跑分是 ARC-AGI-3。

这个测试难在不给 AI 说明书、不给规则、甚至都不告诉 AI 目标是什么,模型进去只能自己乱按,慢慢摸清怎么才算赢,再把摸出来的规律用到更难的关卡上。

它考查的不是 AI 的知识,是悟性。

今年 3 月这个测试刚发布的时候,最强的 AI 只有 0.51 分,人类平均 48 分,GPT-5.6 Sol 是 7.8 分。

而 Astra 做到了 99.9 分!

ARC-AGI-3 跑分

把这称作 AI 的开悟时刻,不过分吧?

再看看 GPT-6 的数学能力,FrontierMath Tier 4 这套题 Astra 拿到 97.6%,基本上算是打穿了。

FrontierMath Tier 4 跑分

最后说说大家关心的价格。API 里的模型 ID 是 gpt-6-astra,每百万输入 token 10 美元、输出 50 美元,跟 Claude Fable 5.1 一模一样,是自家上一代 GPT-5.6 Sol 的 2.5 倍,涨得还是挺狠的。

但是考虑到大多数用户都是在 Codex(ChatGPT)中使用套餐,再加上官方老是赠送重置额度,实际开销没有那么大。

实战案例

跑分看着很爽,但我更关心 GPT-6 做出来的东西是什么效果。

官方这次放了不少实际案例,我挑几个有意思的说说。

先看一个最能体现「操作电脑」能力的。官方让 Astra 打开 KiCad 这个电路设计软件,把一张电子原理图变成可以直接拿去生产的电路板布线图,元器件怎么摆、铜线怎么走全都是它自己完成的。

Astra 在 KiCad 里完成电路板布线

这活儿平时是硬件工程师一点一点手工拖出来的,也是整个电子设计流程里最费时间的环节之一。

然后是 3D 建模能力,官方展示了让 Astra 直接建出一整座城市场景,楼体、道路、绿化带、斑马线、路上的车,一个都不少。

Astra 建出来的 3D 城市场景

不光是建静态模型。官方还演示了先在 Blender 里把一栋房子建出来,再导进 Unreal Engine 5 变成可以自由走动的场景,让设计师和客户在开工之前就能提前逛一遍。

再看看游戏开发能力,官方直接在发布页面里嵌了两个能玩的网页项目,鼠标点进去就能上手。

第一个是卡丁车竞速游戏,这是完全用 AI 程序化生成的 Three.js 卡丁车赛车,赛道和场景不是靠网上的素材堆出来的,是靠代码算出来的。

Tidal Rush 卡丁车游戏的实际画面

我自己上手跑了两圈,速度表、漂移条、小地图、名次和圈数都在,手感也不飘。沙滩的高光、水面的透光、椰子树的剪影、彩旗的排布,这水准我觉得已经超过不少外包团队交的活儿了。

第二个案例更酷炫,是个宇宙飞船船厂。每换一个随机种子就能生成 1000 艘不重复但可复现的飞船,全部由 177 个模块化零件拼出来,每一艘还带尺寸、载货量、推力、装配模块数这些参数。

飞船船厂里 1000 艘飞船的图鉴

左边是舰队列表,中间是整页图鉴,右边是选中那艘船的详细规格,还能导出成一张拼版图。

除了官方,一批提前拿到内测权限的人也在 Twitter 上晒了自己的测试,有几个我觉得比官方演示还带劲儿。

Matt Shumer 让 Astra 在 Unreal Engine 里造一个世界,往里面填满由 Astra 驱动的角色,要求他们必须互相合作才能活下去。第二天他在卧室里听见客厅有人说话,以为家里进人了,走出去还有点害怕,结果是那些 AI 角色自己开始互相聊天了。

一位研究 T 细胞三十五年的免疫学教授,只给了 AI 一句「做一个 5 分钟讲 T 细胞的教学视频」,Astra 自己挑了视频框架、调文生图做画面、还主动建议用 AI 配音,最后一次性把讲什么、怎么讲、配什么画面全组装好了。

教授说:凭他三十五年的经验,他自己也讲不了比这更好。

看完案例你可能会想:官方是拿什么样的提示词做出这些东西的?

这个问题其实有答案。OpenAI 有一个 开发者展示馆,里面收录了五十多个用 Codex 做出来的项目,而且 每个案例的详情页都把当时用的提示词原文一字不改地贴出来了,后面还列了每一轮迭代都改了什么

OpenAI 官方开发者展示馆

虽然这个展示馆不是这次跟 Astra 一起发的,里面的案例大多是用 GPT-5.5 和 5.6 做的,但我觉得值得给大家分享一下,看官方的提示词能收获不少 AI 编程的启发。

随便分享 2 个,第一个启发是 要逼 AI 自己验收

比如玻璃塔堆叠游戏的提示词,最后一句是这么写的:

Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors.

意思是先跑构建和代码检查,然后让 AI 在浏览器里玩几局,把碰撞、计分、失败和重开都验一遍,控制台不许有报错。

Glass Towers 玻璃塔游戏

这就是我一直在讲的 Loop Engineering,让 AI 写完自己验,验证不通过就自己修复。官方把它写成了提示词里的硬要求。

第二个启发是 先画图再写代码

小镇模拟游戏的提示词最后一段,是让模型先用文生图工具画几张玩法概念图,把视觉方向定下来,再开始写代码。

MiniTown 小镇模拟游戏

如果你平时让 AI 做前端总觉得出来的东西土,这一招直接助你羽化登仙。

剩下的案例我就不逐个讲了,放一张成品感受一下水平。

Terrain Mixer 程序化地形生成器

AGI 时代真的来了么

虽然官方把 GPT-6 Astra 吹得狂拽炫酷吊炸天,我看了官方展示的案例也觉得很牛呗,但是网上有很多不同的声音。

第三方评测机构 Artificial Analysis 在发布当天就出了独立评测,结论跟官方不太一样。在他们的综合智能指数里,Astra 是 61 分,跟上一代 GPT-5.6 Sol 一模一样,比 Claude Fable 5.1 还低了 5 分。

Artificial Analysis 的独立评测

图里右边那一栏是单个任务的成本,Astra 1.67 美元,GPT-5.6 Sol 0.94 美元。智能指数一分没涨,成本快翻倍了!

所以「全球最强」这个说法,在 OpenAI 自己挑的那批测试上成立,一换成第三方的综合指数就未必成立了。

而且根据历史情况,我们可以大胆假设,GPT-6 Astra 大概会像其他模型一样,第一周用起来像是在跟神说话,一周后厂商为了省算力搞一波降级,再用起来就像是在跟三岁小孩说话,两周后被用户投诉多了,就再把智力调回来一点,几周之后再发布 GPT-6.1,然后循环……

就分享到这里吧,等我拿到 GPT-6 Astra 的使用权限,再跑几个 AI 编程实战项目测测看。

本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

评论区有没有已经用上 GPT-6 Astra 的朋友,聊聊你们的使用感受?

相关文章
|
9天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
20天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13289 91
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
14天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1814 4
|
15天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
2011 1
|
9天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5282 0
|
6天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。

热门文章

最新文章