我终于能用 GPT-6 了!实测一波,Codex 要杀疯了?

简介: GPT-6 Astra 实战测评,4 大项目实战,覆盖 AI 编程能力和 Computer Use 电脑操作能力,看看号称全世界最智能的模型,在 Codex 中的使用体验到底如何?和 Claude Fable 5 比起来怎么样?

大家好,我是程序员鱼皮。

前几天 OpenAI 发布了 GPT-6 Astra,号称全世界最智能的模型,主打像人一样操作电脑和自主完成编程任务。

我看了一圈官方展示的案例,3D 城市生成、3D 卡丁车赛车游戏等等,效果确实震撼。

官方展示的 3D 卡丁车游戏

当时我就想第一时间跑轮实测,结果打开 Codex 一看,没有 Astra 的选项。

我以为是自己账号的问题,又专门买了个新账号,结果还是没有!

唉,只能「望模兴叹」了……

现在,我的 Codex 终于有 GPT-6 Astra 的权限了,赶紧搞几个实战项目测测看。

这次我选择了 4 个案例,由浅入深:

  1. 3D 程序化城市生成器(对标官方 Showcase,纯前端)
  2. 3D 奥德赛战争视频动画(前端 + 后端,专业运镜)
  3. 全栈 AI 编程工具(复杂长程全栈任务,跟 Fable 5.1 横评对比)
  4. 操作 KiCad 完成电路板布线(Computer Use)

点个收藏,咱们开始~

1、3D 程序化城市生成器

OpenAI 官方的开发者展示馆里有一个用 GPT-5.5 做的程序化城市生成器,编辑器风格的界面加上实时 3D 渲染。我想看看 Astra 能不能做到更好的水平。

官方的城市生成器

提示词里我就强调了一件事,至少包含重庆、上海、西安、深圳、江南五种城市风格,要让用户一眼就能认出是哪座城市。

之所以选重庆当主打风格,是因为层叠立交的复杂地形在国内辨识度极高,最容易看出 AI 到底有没有理解城市特色。此外,参数维度和编辑器布局怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。

Case 1 提示词

AI 拿到任务后,先用 Firecrawl 搜索了官方 Showcase 的产品设计,又查了 Three.js 的文档,然后一口气把整个项目写完了。

过了大约 18 分钟,7 项自动化测试全部通过,前端项目构建成功。

来看看成品,第一眼就被惊艳到了……

重庆 · 8D 魔幻山城

网站右侧是完整的城市生成器控制面板,城市风格、城市形态、建筑密度、平均高度、地形与交通、光照氛围全都能调。你随便拖动一个滑块,3D 场景就会实时重新生成。底部是五种城市风格的预览卡片,一目了然。

重庆的 3D 场景确实做出了高差感,建筑群层叠在地形的起伏上,标注了立交层数和轨道交通的位置。

再看看切换其他城市风格的效果。上海版是滨江平地加超高层密集,色调完全变了,标注了东方明珠和上海中心。

上海 · 陆家嘴天际线

西安版的特色也很鲜明,城墙围合结构、中式屋顶、低矮建筑群,整个色调偏暖土色,标注了大雁塔和钟楼中轴。

西安 · 千年长安城

深圳版切换到了暗色调,超高密度的玻璃幕墙建筑群,标注了深圳湾,赛博感十足。还能看到道路上的小车,很细节。

深圳 · 赛博未来都市

江南版的画风跟前四个完全不同,白墙黛瓦、小桥流水、低层建筑,水系穿城而过。

江南 · 枕水人家

这五种风格切出来视觉差异非常明显,不是简单换个颜色,建筑形态、地形高差、地标标注全都跟着变了。

这个完成度已经超出我的预期了。只用一段提示词,AI 运行 18 分钟就完成了开发和校验。之前用 Claude Fable 5.1 做同等复杂度的项目基本上要半小时起步,Astra 快了不少。

2、3D 奥德赛战争视频动画

第二个案例难度拉高。我让 AI 做一个 3D 史诗级战争场面的视频动画,主题是古希腊奥德赛的特洛伊战争,而且这是一个前端 + 后端的全栈项目。

这个案例最核心的考点是运镜。我要求整段动画要体现专业的运镜手法,不同段落用不同类型的镜头,镜头之间的转场要自然,战场上要有大规模的士兵群体。具体怎么实现、后端承担什么职责,全部交给 AI 自己设计。

Case 2 提示词

AI 先搜了特洛伊战争的经典场面和电影运镜手法,然后自己设计了一套前后端架构。前端用 Three.js 做 3D 场景渲染和镜头动画,后端用 Node.js 提供两个接口,一个根据场景配置生成分镜脚本,另一个调用 ffmpeg 把前端渲染的帧序列编码成 MP4 视频。

大约 19 分钟后,AI 交卷了:

特洛伊之围 · 开场

打开网页,一整片黄昏色调的战场直接扑面而来,大规模的士兵方阵、城墙城门、远处的战舰群都在。底部有完整的时间轴播放器,可以拖拽进度、调倍速、全屏播放,右上角还有「导出影片」按钮,对接的就是后端的 ffmpeg 导出接口。

特洛伊之围 · 战争推进

动画播放过程中,镜头确实在持续运动,从远景推向近景,能看到摄像机角度在截图之间有明显变化。

特洛伊之围 · 镜头推进

整段动画分成了六个章节,72 秒完整叙事,从风暴将至的全景一步步推到近距离搏杀,最后拉远收束。镜头轨迹的加速度都做了连续性处理,章节字幕是渐隐渐现的。

特洛伊之围 · 六个章节

过程中,AI 在自验证阶段发现了远景雾气太重、角色脚底悬空等几个问题,自己修了两轮,最后跑了 9 项测试全部通过。

不过也有明显的瑕疵,有几处角色穿模,士兵的武器偶尔会穿过身体,这种问题让 AI 再跑一轮修复大概率能搞定。

特洛伊之围 · 穿模问题

整体来看,这个项目从产品设计到技术实现都很完整。虽然 3D 模型本身是低多边形风格的,不是很精细的建模,但考虑到这是一段提示词从零做出来的全栈项目,已经很强了。

3、全栈 AI 编程工具 - 复刻 Cursor

这是我经常用的一个测试案例,让 AI 复刻一个像 Cursor 那样的 AI 编程工具。提示词跟之前测 Claude Fable 5.1、Kimi K3、DeepSeek V4 Pro 时用的 完全一样,好跟这些模型横向对比。

简单来说,我要求 AI 先克隆 VS Code 的开源代码,然后在此基础上做一个支持 Editor Window 和 Agents Window 双窗口切换的 Web AI 编程工具。Editor Window 负责代码编辑,Agents Window 负责 AI 对话和自主开发,技术栈让 AI 自由发挥。

Case 3 提示词

AI 拿到任务后同时做了两件事,一边用 Firecrawl 搜索 Cursor 3 的产品设计,一边通过 Git 命令克隆 VS Code 仓库。

然后花了大约 23 分钟,完成了第一轮开发。

有意思的是,AI 没有直接把产品叫做「Cursor 复刻版」,而是自己取了个产品名叫「orbit」,顶部中间就是 Editor / Agents 双窗口切换按钮。

先来看看 Editor Window 编辑器模式的效果:

整体布局参考了 VS Code,比如左侧文件树、中间 Monaco 编辑器、上方多标签页和面包屑导航、下方终端面板、右侧 Agent 对话面板。但又跟 VS Code 不完全一样,比如暗色主题配色、活动栏图标、状态栏信息这些细节都做了自己的设计,更像是一个独立产品而不是简单的换皮。

切换到 Agents Window,这就是我们熟悉的 AI 对话界面了:

Agents Window

Agents 面板有完整的任务管理能力,中间是对话输入区,下方已经配好了 deepseek-v4-pro 模型选择和 Agent 模式。

AI 能够正常完成简单的开发任务,核心功能都能跑通:

跟之前我测试过的几个模型横向对比一下。

Kimi K3 那次花了半个多小时,核心功能跑通了,但是界面比较简陋。

Kimi K3 的复刻 Cursor

再来看看 Claude Opus 5 用同样的提示词做出来的版本,代码高亮、小地图、管理面板都在,还原度很高,但说实话跟 VS Code 太像了,少了点自己的想法。

Claude Opus 5 的复刻 Cursor

Claude Fable 5.1 的完成度最高,有完整终端、Agent 执行流程和文件审阅机制,还能逐文件接受或拒绝 AI 改动。

Claude Fable 5.1 的复刻 Cursor

GPT-6 Astra 这次最让我惊喜的是它有自己的产品想法。没有完全照着 Cursor 去抄,而是自己设计了 orbit 这个品牌、自己加了任务分类管理和三个快捷入口、自己定义了暗色主题的配色体系。在 Editor Window 的视觉还原度上也做到了几个模型里最好的。

不过整个编辑器的功能丰富度还差 Fable 5.1 一截,像逐文件审阅改动这种功能 Astra 是没有做出来的。

4、操作 KiCad 完成电路板布线

前面三个案例测的都是 AI 写代码的能力,但 GPT-6 Astra 这次主打的其实是「操作电脑」。官方称它是全世界最强的电脑操作模型,ScreenSpot-Pro 的屏幕理解准确率从上一代的 76.9% 直接拉到了 92.7%。

官方的案例展示中,让 Astra 打开 KiCad 电路设计软件,把一张电子原理图变成可以直接拿去生产的 PCB 布线图,元器件怎么摆、铜线怎么走全部由 AI 自己完成。

官方演示:Astra 在 KiCad 里完成电路板布线

要知道,以前这玩意是硬件工程师一点一点手工拖出来的,是整个电子设计流程里最费时间的环节之一。

我想仿照这个案例自己试一试,于是在本机装了 KiCad 10,看看 Astra 能不能自己操作 KiCad 完成从原理图到 PCB 布线的全过程。

Case 4 提示词

这个案例跟前 3 个完全不同,AI 没有写代码,而是像人一样看屏幕、点按钮、拖拽元器件。

过了大约 13 分钟,AI 完成了任务。

它确实成功操控了 KiCad 的界面,打开项目、进入 PCB 编辑器、从原理图导入网表,这些流程操作都做对了。原理图一致性检查也通过了,说明 AI 看懂了原理图和 PCB 之间的对应关系。最后它还自己跑了一次 DRC 设计规则检查。

但是没能完成正确的布局和布线。我发现 AI 在画布上点击和框选元器件的时候,坐标经常对不准,没法可靠地把元器件拖到指定位置,更别说一根根地画铜线了。最终 DRC 报了 12 项违规和 20 处未连接。

这个结果让我挺失望的,因为我看了很多博主分享 Astra 操作 Blender 创造各种 3D 大作,成品都很惊艳,怎么到我这就翻车了呢?

从我自己的测试结果来看,Astra 在「看懂专业软件界面」和「找到正确的菜单按钮」这两件事上做得不错,但是却卡在了精细的画布交互上。这也侧面解释了为什么官方的 ScreenSpot-Pro 跑分能到 92.7%(看懂屏幕没问题),但 OSWorld 的任务完成率只有 72.6%(真正把活儿干完就难多了)。

我的感受

跑完这几个项目,我最直观的感受是:Astra 的前端审美和产品设计能力比 GPT 5 系列提升太多了!

以前大家测试 GPT 系列的模型,前端效果经常是被吐槽的点,而且 GPT 特别爱偷懒,功能能省就省,以快速完成为主。

比如之前我用 GPT-5.6 Sol 做出来的足球游戏界面是这样的:

GPT-5.6 Sol 的足球游戏

是的,那一坨黑色方块就是球门……

这次 GPT-6 Astra 的使用体感有明显变化,比如 3D 城市生成器那个项目不光功能做全了,连每座城市的地标标注都自己设计了一套,这种用心程度在以前的 GPT 身上是看不到的。

奥德赛战争那个项目也是,完整的 72 秒六章叙事、后端分镜脚本引擎加 ffmpeg 导出、连镜头轨迹的加速度连续性都做了处理。而且速度真的很快,几个项目 20 分钟左右就交卷了,比其他同级别模型快了将近三分之一。

但是我实测下来,感觉 Astra 消耗的 Codex 额度明显更快了,价格比之前贵了不少。基础的 Plus 账号跑 2 ~ 3 个项目就能把 5 小时额度耗光了,Computer Use 消耗更大,想长期用至少得开 Pro。

所以 Astra 到底值不值得用呢?

如果你做的是视觉要求高的前端项目,或者需要一次性交付的全栈产品,Astra 目前确实是第一梯队。

对于日常大多数的办公任务,没必要用这么贵的模型,国产的 Kimi、GLM 或者 DeepSeek 够用了。

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你用 GPT-6 Astra 了么?觉得它是目前最强的模型吗?

相关文章
|
3天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1102 0
|
12天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3685 3
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
23天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13472 93
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
17天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1955 5
|
3天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
846 0
|
12天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
9天前
|
人工智能 并行计算 数据可视化
秋叶ComfyUI-AKI最新整合包|完整部署教程+核心指令手册
秋叶ComfyUI-AKI一键整合包,国内适配最优、稳定性最强的商用/学习级版本:全封装虚拟环境、预装90%常用节点、内置绘世启动器与成熟工作流,免配置、零依赖、解压即用,完美兼顾新手入门与专业批量生产需求。(239字)
|
9天前
|
人工智能 监控 测试技术
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
8月26日,通义千问发布Qwen3.8-Flash-Next:125B参数、每Token仅激活6B,原生支持26万Token、可扩展至100万上下文;Coding、Agent与工具调用能力显著增强,面向真实软件工程任务,推动大模型从“回答问题”迈向“完成工作”。

热门文章

最新文章