CUDA 的护城河从来不是 GPU:DeepSeek 开源昇腾基础组件后,这事被低估了

简介: DeepSeek 在 GitHub 上放出了一批面向华为昇腾算力平台的基础设施组件。很多人第一反应是"又一个国产替代的进度条"。我的判断不一样:这件事真正的价值不在"国产芯片又追上了一点",而在它动的是 CUDA 最深的那道护城河,软件栈。

9 月 30 日上午,DeepSeek 在 GitHub 上放出了一批面向华为昇腾算力平台的基础设施组件。很多人第一反应是"又一个国产替代的进度条"。我的判断不一样:这件事真正的价值不在"国产芯片又追上了一点",而在它动的是 CUDA 最深的那道护城河,软件栈。

模型能力换代的窗口大概三五年,软件栈的迁移窗口往往十年起步。这是我愿意认真聊它的原因。

一、先看清楚开源了什么

把清单摆出来,比空谈"意义"有用。

这次开源的是和英伟达平台一一对应的一套组件。TileLang,面向昇腾的高级语言编译工具,对 Ascend C 指令做封装,用高层写法就能拿到接近手写的性能。DeepGEMM-Ascend,矩阵乘算子库,和 NVIDIA 版 DeepGEMM 完全 API 兼容,精度上从 BF16 一路支持到 FP4,另外还覆盖 MQA logits 和 MegaMoE 这类特殊算子。DeepEP-Ascend,MoE 专家并行的通信库,公开 buffer API 与 NVIDIA 版 DeepEP 对齐。此外还有几个算子库。FlashMLA 负责稀疏注意力,DeepSelect 负责稀疏注意力里的筛选,TileKernels 则用 TileLang 覆盖向量计算与访存。

我在 GitHub 上核过时间和仓库。DeepGEMM-Ascend、DeepEP-Ascend 都是 9 月 29 日晚到 30 日新建的,README 写得很直白:"developed and validated on the Ascend 950 series",在昇腾 950 系列上开发和验证,API 与英伟达版保持一致,用户装完包就能沿用原来的开发流程。DeepEP-Ascend 还直接贴了一张实测表:在昇腾 950DT 加 CANN 9.2.0 上,EP8 规模的 dispatch 带宽能跑到 373 到 375 GB/s。

单个数字没什么,连起来看信息量就出来了。这不是迁移文档,是生产环境里真在跑的实现。DeepSeek 也提到,TileLang 路线已经承载了 V4 系列训练里大部分算子,训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

二、为什么会这样:CUDA 的护城河从来不是硬件

要理解这步棋的分量,得先说清一个被反复误读的事:CUDA 到底强在哪。

外行容易以为英伟达的壁垒是 GPU 本身。芯片参数其实追得动。这两年国产卡的单卡算力和显存带宽,和主流产品的差距一直在收窄,部分推理场景已经能接。难追的是十几年堆出来的工具链:编译器、算子库这些底层工具,以及上面那一整套开发者习惯。

这个判断不是我拍的。前阵子读到一篇行业分析,里面有句话我印象很深。很多企业买回国产算力集群,硬件通电只要几个月,把主流大模型完整迁过去、调好算子,却要投一大堆工程师,耗上更长周期。更要命的是,模型一迭代,适配工作还得重来一遍。

于是国产算力卡在一个负向循环里。开发者不熟,就缺人做迁移;上层应用少,企业就不敢买;芯片厂商拿不到足够订单,也没资金养软件栈。

DeepSeek 开源这批组件,动的就是这个循环的起点。它把"模型团队在国产芯片上跑不出性能"里最卡的软件栈环节,替行业走完了一半,算子实现和通信库、编译路径全给出来,而且和 CUDA 侧接口对齐。

它不是要再造一个 CUDA。它是把 CUDA 生态里最值钱的那一层,用开源的方式在昇腾上补齐。

背后的推手也不只是技术。往前看一个月,彭博社报道过,DeepSeek 计划在内蒙古数据中心部署至少 16 万颗昇腾 950DT。另一面是,有报道称昇腾 950DT 受高端内存良率限制,全年产量只有数十万颗,还要顾及其他客户和出口订单。换句话说,V4 系列训练目前主力还得靠英伟达,但把训练和推理的成本结构往国产平台挪,是它必须提前布局的事。开源组件,本质上是给自己未来的算力账单铺路。顺带,整个行业的路也铺了。

三、意味着什么:从"能跑"到"好用"

我更愿意把 2026 这个时间点,看成国产算力的分水岭。

CNNIC 的上半年数据能说明规模。截至 2026 年上半年,中国智能算力规模达到 2185 EFLOPS,同比增长 177%,首个全国产 10 万卡 AI 超集群正式投用,从芯片到散热核心软硬件全部国产。生成式 AI 用户规模突破 7 亿,普及率超过 50%。去年同期还是 5.15 亿、36.5%。

硬件这一关,基本过了。上下半场的分界很清楚:上半场拼"有没有卡",下半场拼"好不好用"。而好不好用这件事,九成是软件栈的事,剩下一成才轮到硅片。

DeepSeek 这一手,等于用一家头部模型公司的工程信用,给昇腾的软件栈做了背书。它对行业的影响,是把一道原本要每家自己做的适配题,变成了可复用的公共品。多一组开源仓库只是表象。后面再有人要迁模型,起点不再是"从零啃算子",而是"改改接口跑起来"。

不过得泼点冷水。这些组件是在昇腾 950 系列上验证的,更早的 910B 等型号未必直接受益。高层语言加上运行时编译(JIT)用多了,调试链路也会更复杂。开源只是把门槛从"能不能"降到"怎么调",真正的规模化还得看社区后面能不能把坑填平。这件事的分量在开局,不在终局。

四、放回更大的局里看

我平时做的是品牌在 AI 时代的可见度,所以特别在意一件事:这类基础设施级的动作,不会只影响它自己那一层。

打个比方。软件栈的护城河一松,受影响的从来不只是芯片。编译器松了,模型团队才敢迁;模型团队迁了,推理成本才会降;推理成本降了,上层那些依赖大模型跑批量的应用才可能真正上规模,比如内容生成、社媒自动化,再比如 AI 搜索。

这和当年云计算的路径很像。有一朵云本身不值钱,值钱的是云之后长出了整个 SaaS 层。国产算力软件栈补齐之后,长出来的会是"用得起、跑得动"的 AI 应用层。我们做的生意,恰好落在这一层里。

五、该怎么应对:两个层面的判断

分两种人来说。

如果你在做技术选型。这次开源给国产栈开了一个明确的试点窗口。我的建议是先挑推理链路里最成熟的算子做小范围验证,也就是 DeepEP、DeepGEMM 这些接口已经和 NVIDIA 对齐的部分,迁移成本最低。别一上来就全量迁训练,那个周期和风险,现在还没到能拍胸脯承诺的时候。

如果你在做品牌营销。这件事对你能感知到的变化,是 AI 搜索里的答案质量会加速提升。当推理越来越便宜,像豆包和 DeepSeek、千问这些 AI 助手,能处理的问题会越来越复杂,用户拿它们做选品、比价,或者查机构的口碑,比例会继续往上走。这带来一个新现实:品牌在 AI 答案里有没有被提到、被怎么提,正在变成和搜索排名一样重要的曝光位。

这也是我们做声量 Shengliang 的出发点。我们把品牌内容在全网的分布、被 AI 引用的情况,以及社媒矩阵的运营,放进同一套系统里看。一边通过 GEO 优化(生成式引擎优化)让品牌内容更容易被 AI 抽取和引用,一边用社媒智能体把内容的生产和分发自动化,再通过 AI 可见度监测,7×24 追踪品牌在各个 AI 平台被推荐的实际情况。门槛降下来之后,真正拉开差距的,是谁先把"被 AI 看见"这件事变成一套可衡量的日常动作。

写在这波热度之后

回到 DeepSeek 这次开源。让我停下来的是 README 里的一句话:用同一个包名,让用户沿用原来的开发流程。一个模型团队愿意让国产芯片"无缝替换"得这么自然,这比任何发布会上的口号都实在。

组件开源是今天的事,用户习惯的迁移是接下来一两年的事。早动手的团队,拿到的不只是更低的成本,是一个更早被 AI 记住的窗口。

相关文章
|
18天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8625 25
|
17天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
3072 14
|
16天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
2115 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
5天前
|
人工智能 JSON Linux
【全网最详细】ComfyUI使用教程:下载+本地部署+配置+工作流搭建一篇搞定(2026最新版)
ComfyUI是一款免费开源的本地AI绘图工具,采用节点式工作流设计,支持文生图、图生图、局部重绘、放大、换脸等多种功能。可离线运行,依赖显卡加速,无需联网。支持自定义流程保存与分享,插件生态丰富,适合进阶用户。(239字)
|
17天前
|
云安全 人工智能 安全
|
11天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
11天前
|
人工智能 JSON 编解码
【2026最新版】ComfyUI本地部署教程,新手也能看懂!
ComfyUI是本地运行的AI绘画工具,采用节点式工作流设计:通过拖拽连接“加载模型”“提示词编码”“采样”“解码”等模块,实现高度可控的文生图。新手推荐使用秋叶整合包,一键启动、内置模型管理与插件安装器,轻松上手。(239字)