OpenClaw 2.0 来了,Astra 有点吓人,三大 AI 服务同日宕机

简介: 摘要:听说 Astra 的效果让人很惊吓

这期的「周一上线」,一边是新模型和 Agent 工具继续往长任务、电脑操作和自主研究上推进,一边是 AI 圈的大交易和基础设施问题也没闲着。

OpenAI 发布 GPT-6 Astra,Anthropic 带来 Claude Fable 5.1 和 Mythos 5.1;Meta 则把自主研究系统 AIRA₃ 拉去参加 Kaggle,最后拿到了金牌。OpenClaw 原本只想简化安装和浏览器体验,做着做着干脆变成了 2.0。

另一边,英伟达花 129.303 亿美元买下 Hugging Face,连收购价里都藏了个 🤗;Anthropic 的 IPO 时间表继续往后挪,ChatGPT、Claude 和 Grok 还在同一天撞上了服务故障。

下面,开始一周回顾。

有点新鲜

「有点新鲜」收录本周 AI / 开发者圈里那些不算大新闻,但挺值得看一眼的新鲜事。

Hermes 速查表

Hermes command cheat sheet 更新,新版收进了 /goal/loop/heartbeat/bg/btw/plan/review/refine/moa/busy 等命令,并按上下文、任务控制、计划、模型、Skills、Memory、自动化和故障恢复等场景重新分类。

1.png

首尔的 3D 地图

synabreu 用 GPT-6 Astra 做了一个可以探索的 3D 首尔地图。

2.gif

这个项目覆盖首尔全部 25 个区,包含约 26.7 万个简化建筑模型,支持旋转、缩放、平移,以及 14 个地标的自动巡游,还做了白天、黄昏和夜晚三种模式。

地图使用 OpenStreetMap 等真实地理数据,再通过 Three.js 渲染。更夸张的是,从创建项目到完成部署,一共用了 43 分 38 秒。

恐怖的人像建模

ojigineko_tips 给 ChatGPT-6 Astra 一张图片,让它把图片转成 3D 模型,再做成可以 360° 旋转的效果。

3.gif

这大概是恐怖片完成了。

能动的果冻宝宝

Jelly Baby 是一个 WebGPU + Three.js 做的软体物理小游戏。

4.png

这颗大约 7cm 高的果冻宝宝可以自己走路和跳跃,你还可以用鼠标抓住它,拉长、拖动,甚至整个扔出去,看它软趴趴地摔回来。

在线试玩:jelly.scottsun.io

ChatGPT:我能用一下 Claude 吗?

Will Brown 晒出一张 Computer Use 的授权弹窗:

5.png

GPT-6 Astra:距离 AGI 可能还差一只豹子

@gxjo_dev 用 Astra 生成了一只奔跑的豹子,并表示:GPT-6 Astra is definitely NOT AGI.

6.gif

禁止 AI 控制服务器

机房必贴图:

7.png

周五发版

「周五发版」是一个程序梗:一旦版本上线,我们就要开始祈祷一切如期运行。这个模块寓意,所有模型、产品版本更新,都能大吉大利。

OpenClaw:本来想改改安装流程,一不小心做成 2.0

OpenClaw 发布 2.0,也是项目迄今规模最大的一次更新:933 名贡献者参与,其中 569 人是首次贡献,总计涉及超过 1.6 万个 PR。

8.png

这个版本最开始只是想让安装更简单、把浏览器端重新做好。结果把消息、Memory、Skills、模型、自动化、原生应用、插件和安全都做了迭代。

新的安装流程会识别电脑上现有的 ChatGPT / Claude 订阅、API Key 和本地模型;浏览器端打开后就进入 Agent 对话。新加入的 Shared Cloud Sessions 还能让团队成员进入同一个工作会话,接手任务时保留原来的上下文。

GPT-6 Astra:OpenAI 新一代旗舰模型

OpenAI 发布 GPT-6 Astra,重点提升 Computer Use、浏览器操作、软件工程、网络安全、科学研究和专业工作。

9.png

在官方公布的测试中,Astra 在 FrontierMath Tier 4 得到 98%,ARC-AGI-3 得到 99.9%,ExploitBench 达到 100%。Computer Use 也明显提速:在 OSWorld 2.0 的延迟模拟中,Astra 得分 72.6%,单任务约 40 分钟;GPT-5.6 Sol 为 65.7%,约 75 分钟。

Astra 还加入了新的长任务上下文机制。在 Codex 中,它可以跨上下文窗口保存工作笔记,并搜索早期对话和工具结果,减少长任务反复压缩后丢失细节的问题。模型将陆续进入 ChatGPT、API、Azure 和 AWS Bedrock。

更多参见:https://mp.weixin.qq.com/s/9PpbkJdS8tR2YCCw3CBo4w

Claude Fable 5.1 / Mythos 5.1:一个模型,两套安全边界

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1。

10.png

两者使用相同的底层模型,区别主要来自 Safeguard。Fable 5.1 面向一般用户开放;Mythos 5.1 通过 Trusted Access 提供,面向网络安全和生命科学等更敏感的专业工作。

Fable 5.1 还下调了 Cache Read 的价格。Anthropic 估算,在按 Token 计费的常见任务中,成本相比 Fable 5 可下降约 25%;Agent 密集型任务最高可节省约 45%。

更多参见:https://mp.weixin.qq.com/s/PjoAW7VJTYe_59l5OuWFCw

AIRA₃:Meta 把自主 AI 研究员拉去 Kaggle,拿了金牌

Meta 展示了新一代自主研究系统 AIRA₃

11.png

今年 6 月,Meta 让它参加 NVIDIA 举办的 Kaggle 竞赛,自主研究如何微调一个 30B Nemotron 模型。最终 AIRA₃ 在约 4000 支队伍中排名第 8,获得金牌。

AIRA₃ 由多个长期运行的 Agent 组成,它们通过共享文件系统和研究论坛异步协作,互相接着已有发现继续实验。Meta 还表示,这套系统在其他内部任务中也被用于 GPU Kernel 优化等工作。

Google 用 AI 拼出了雄性果蝇完整大脑图谱

Google Research 联合 HHMI Janelia 等研究团队,首次完成了成年雄性果蝇完整大脑和中枢神经系统图谱。

12.png

研究团队利用 AI,把数百万张二维图像组合成三维神经结构,最终重建出超过 16.6 万个神经元。

开源雷达

周榜速递

周榜主要根据新增 Star 数进行排名,下面的单项目讲解则偏向新晋项目、实用老项目,标星并非单项目讲解的唯一指标。

13.png

zvec:把向量数据库嵌进应用里

zvec 是阿里开源的一款 In-process Vector Database,可以跟着应用进程一起运行。

14.png

它不需要单独启动数据库服务器,也不需要额外配置服务,支持 Dense / Sparse Vector、全文检索、结构化过滤和 Hybrid Search,并通过 WAL 做持久化。

新版还提供了 zvec-grep:把 ripgrep、BM25 和向量搜索放进一个 CLI,既可以用来搜索代码和文档,也可以给 AI Agent 做本地 Workspace Search。

地址:github.com/alibaba/zvec

marijanapav.com:把个人作品集做成一个设计实验场

这是设计师 Marijana Pav 的个人网站开源项目。

15.png

它一部分是 Portfolio,一部分是 Playground,用来持续放自己的设计作品和视觉实验。

其中 stamps 页面是作者把祖父收藏的邮票重新数字化和设计,做成一套在线集邮册;sketchbook 则拿来存放未成形的设计想法、小测试和视觉实验。

地址:github.com/buka-studio/www-marijanapav

Ponytail:给 Coding Agent 装一个“懒惰高级工程师”脑回路

Ponytail 是一套面向 Coding Agent 的 Skill,目标是让 Agent 少写没必要的代码。

16.png

Agent 开写之前,会先依次检查:这个东西真的需要存在吗?代码库里有没有现成实现?标准库能不能解决?平台本身有没有?装过的依赖能不能复用?一行代码能不能搞定?全都不行,再写最小实现。

比如要日期选择器,它会优先考虑浏览器原生 <input type="date">,而不是先安装一个组件库再包一层组件。

项目自己的 Agent 测试中,使用 Ponytail 后平均代码行数减少 54%,Token 减少 22%,耗时减少 27%。

地址:github.com/DietrichGebert/ponytail

TimesFM 3.0:Google 的时间序列基础模型

TimesFM 是 Google Research 开发的时间序列预测基础模型,目前更新到 TimesFM 3.0。3.0 加入原生多变量和单变量预测,同时支持只包含历史数据、以及同时包含历史与未来信息的 Covariate,可以用于销量、流量、能源、金融等时间序列预测场景。

地址:github.com/google-research/timesfm

NInfer:专门榨一张 RTX 5090 的 Qwen 推理引擎

NInfer 是一个从头使用 C++ / CUDA 编写的单 GPU 推理引擎。

17.png

它目前支持多款 Qwen3.6 / Qwen3.8 Checkpoint,可以处理文本、图片和视频输入,并提供 CLI 以及兼容 OpenAI / Anthropic 的 HTTP API。

地址:github.com/Neroued/ninfer

这周有事

「这周有事」收录本周值得记一下的行业动态、事故、融资、人员流动和基础设施变化。

英伟达 129.303 亿美元买下 Hugging Face,收购价里还藏了个 🤗

英伟达宣布以 129.303 亿美元收购 Hugging Face,成为公司规模最大的收购之一。

交易中约 119 亿美元支付给 Hugging Face 股东,另有最高 10 亿美元用于员工股权留任。英伟达表示,收购完成后 Hugging Face 会继续保持开放和硬件无关,不会限定只能使用英伟达设备。

更有意思的是这个收购价格。

129303 恰好是 Unicode 字符 U+1F917 的十进制表示,也就是 Hugging Face 的 🤗 Emoji。Hugging Face CEO Clément Delangue 还透露,#129303 同时是一种非常接近 NVIDIA 绿色的颜色值。

Anthropic IPO 时间表后移,估值预期最高到 2 万亿美元

据 Reuters 报道,Anthropic 的 IPO 推进时间有所后移,路演目前预计最早在 10 月中旬启动,并计划在 11 月美国中期选举前完成上市。

原计划 9 月初公开的招股书也推迟到 9 月下旬。部分投资者给出的估值预期最高达到 2 万亿美元,同时 Anthropic 正在准备一笔 150 亿美元的循环信贷额度。

ChatGPT、Claude、Grok 同一天出现大面积故障

9 月 3 日,ChatGPT、Claude 和 Grok 在相近时间段出现服务异常。

OpenAI 报告 ChatGPT 和 Codex 错误率升高;Anthropic 多款 Claude 模型出现异常;xAI 的 Grok Web 也发生服务中断。Cursor 等依赖上游模型的产品随后受到波及。

虽然几家服务的故障时间高度重叠,目前没有证据确认它们来自同一个原因。OpenAI 后续将自身问题归因于路由错误,xAI 则表示 Grok 的问题出在 Memphis 计算中心。

留个小题

本周的「周一上线」已经进入尾声。为了给你这周带来一点点小惊喜,在「留个小题」模块会出一道简单的问答题。第一个答对的小伙伴可以联系小七,任选一个七牛周边作为礼品。

小题解答方法:在评论区留下你的答案,小七会在第二天中午 12 点的推文中,告知昨日是哪位小伙伴第一个答对小题。

注意:为了让后面的人可以参与回答,所有评论将会在第二天 12 点统一精选展示。

第 19 期小题:英伟达 129.303 亿美元收购 Hugging Face,这个价格里藏了什么彩蛋?

A. 黄仁勋第一块显卡的序列号

B. Hugging Face 创始团队第一次 Commit 的时间

C. 🤗 Emoji 的 Unicode 十进制值

D. CUDA 工程师随手按出来的一串数字

相关文章
|
2月前
|
机器学习/深度学习 人工智能 监控
AI 模型是如何训练出来的
本文用人类学习类比AI训练,通俗解析大模型如何通过预训练、监督微调与强化学习掌握新技能;详解Model Spec、宪法等行为规范如何引导AI成为可靠协作者,并介绍评测与持续对齐的关键作用。
156 0
AI 模型是如何训练出来的
|
2月前
|
人工智能 自然语言处理 测试技术
从 LLM 评测到 AI Agent 评测,我的一些思考!
本文深入剖析AI评测体系的演进与陷阱,指出当前主流评测方法在Agent场景下的根本性失效:静态数据集、单次测试、只看输出等范式无法应对Agent的动态性、不确定性与系统性。文章提出四大关键转变——从“说了什么”到“做了什么”、从数据集到交互环境、从单点分数到概率分布、从评模型到评完整系统,并倡导构建多维、场景化、闭环的科学评测体系
258 1
从 LLM 评测到 AI Agent 评测,我的一些思考!
|
2月前
|
人工智能 监控 测试技术
银行业AI架构:从裸调API到六层技能体系
# 银行AI智能体架构实战:从单体到Skill协同的技术演进 ## 痛点:银行IT架构的三重困境 走在任何一家银行的科技部走廊里,你都能听到同样的叹息:系统又慢了、需求又排不上、监管又来查了。这不是某一家银行的困境,而是整个银行业IT架构的共性问题。我们把它拆解为三重困境。 **困境一:单体系
|
2月前
|
人工智能 安全 程序员
OpenClaw本地部署TopClaw,小龙虾AI零基础一键安装指南
TopClaw是OpenClaw官方内核的中文汉化版,专为小白设计:一键安装、零代码、免配置,支持Win/Mac全平台。内置模型下载器、本地离线运行、数据不出设备,隐私安全有保障。三分钟即可部署满血AI助手,写稿、翻译、编程轻松搞定。
323 7
|
2月前
|
数据采集 人工智能 缓存
为什么你的推荐系统越做越“笨”?一文讲透电商个性化推荐全链路:从召回到在线排序
为什么你的推荐系统越做越“笨”?一文讲透电商个性化推荐全链路:从召回到在线排序
332 3
|
2月前
|
人工智能 自然语言处理 机器人
阿里云千问大模型最新解析:具体模型与优势、落地场景、选型与定价说明
通义千问作为阿里云自主研发的全栈式开源商用大模型体系,经过多轮版本迭代,现已形成覆盖轻量化推理、通用多模态、旗舰级复杂推理、行业专用、超长文本处理的完整产品矩阵。全系模型适配个人学习开发、中小企业商用、大型企业生产级落地、行业垂直智能化改造等全层级场景,兼顾开源免费部署与云端商用订阅两种模式,凭借稳定的推理精度、极低的幻觉率、强大的长任务自治能力与梯度化定价体系,成为国内落地最广泛、适配性最强的本土大模型之一。本文全面梳理通义千问全系主流模型版本、核心技术优势、细分落地场景、精准选型逻辑与官方定价体系,为不同规模用户提供标准化AI落地参考。
1174 1
|
2月前
|
人工智能 IDE 开发工具
Qoder CN全形态能力解析:多IDE适配的阿里云智能AI编码助手详解
Qoder CN是阿里云推出的新一代智能AI编码助手,由原通义灵码品牌全面升级迭代而来,是面向软件开发全生命周期打造的工程级AI编程智能体。产品彻底打通多端开发环境,同时支持VS Code插件、JetBrains全系IDE插件以及专属独立IDE三种使用形态,适配绝大多数开发者的日常工作流。依托阿里云百炼大模型生态,同时兼容多款国内主流大模型,Qoder CN具备强大的本土化代码理解、工程分析、智能纠错与批量开发能力,能够覆盖个人学习开发、项目迭代、团队规范化研发、大型工程重构等全维度场景,是目前适配性最广、实用性最强的国产AI编程辅助工具之一。
559 2
|
6月前
|
人工智能 缓存 前端开发
网站和APP架构介绍
本文用“开餐厅”类比,生动讲解网站/App开发的完整架构:前端=菜单装修,后端=厨房,数据库=仓库,缓存=出餐口冰箱。涵盖架构图、交互流程与核心资源(域名、服务器、Redis、OSS等),并新增AI时代学习建议——善用大模型写代码、审代码、搭环境,聚焦系统思维与精准提问能力。(239字)
|
2月前
|
存储 人工智能 API
小龙虾安装教程TopClaw中文版,OpenClaw AI免费部署指南
本文手把手教你零代码安装“小龙虾”(OpenClaw AI中文版TopClaw):兼容Win10/11、Mac全芯片,3分钟一键安装;内置中文界面、模型一键下载、本地运行保隐私;支持API调用、VS Code/Obsidian接入,免费、安全、易上手。
498 1
|
1月前
|
机器学习/深度学习 人工智能 算法
2026最新测试岗薪资曝光:会训练AI的拿80万,只会写用例的在投简历
本文揭示2026年测试行业薪资与岗位的结构性巨变:AI测试岗年薪达40–100万+,传统功能测试却跌至10–18万。核心在于“自动化剩余”——AI正快速替代可规则化的测试技能,而懂AI、能构建智能测试体系的人才成为稀缺资源。转型关键:夯实编程、善用AI工具、深入理解大模型评测逻辑。