CUDA的护城河与AI生态的开放之战
CUDA’s Moat and the War for an Open AI Ecosystem
编者按 / Editor’s Note
英伟达的市值神话,表面是Blackwell、Rubin架构的算力胜利,底色却是CUDA近20年浇筑的软件帝国。当AI从"训练独大"走向"训练+推理双峰",AMD的ROCm、Intel的oneAPI/OpenVINO、华为CANN、Google TPU/PyTorch上游化正从四个方向同时撬动这道城墙。本文拆解CUDA护城河的五层结构,并复盘开放生态阵营的真实进度与局限,回答一个问题:开放之战,究竟是在挖墙脚,还是在另起炉灶?
NVIDIA’s market-cap myth looks on the surface like a computing-power victory of Blackwell and Rubin architectures, but its true substrate is the software empire CUDA has poured for nearly two decades. As AI moves from "training-dominated" to "training + inference twin peaks," AMD’s ROCm, Intel’s oneAPI/OpenVINO, Huawei’s CANN, and Google’s TPU/PyTorch upstreaming are prying at this wall from four directions at once. This article decomposes the five-layer structure of CUDA’s moat, reviews the real progress and limits of the open-ecosystem camp, and answers one question: is the open war digging under the wall, or building a new house next door?
一、 CUDA不是编程语言,是"计算封建制"
I. CUDA Is Not a Programming Language, It Is "Computational Feudalism"
2006年CUDA诞生时,外界以为它只是一套"用C写GPU"的工具。20年后回头看,它是一套把开发者、框架、库、硬件、集群管理焊在一起的封建契约。
When CUDA was born in 2006, the outside world thought it was just a tool to "write GPUs in C." Two decades later, it is clear it is a feudal contract welding developers, frameworks, libraries, hardware, and cluster management into one body.
五层锁定结构:
The five-layer lock structure:
-
开发者习惯层:截至2025年,CUDA开发者计划汇聚600万人,涵盖400+库、600+AI模型、3700个GPU加速应用,累计下载5300万次。全球90%的AI教材以CUDA为基准,Stack Overflow上CUDA问题分钟级应答,竞品问题常无人理。
-
框架绑定层:PyTorch、TensorFlow、JAX的官方后端优先为CUDA优化,Llama/GPT/Gemini原始代码全量基于CUDA。移植到非N卡往往要重写数万行核心算子,且性能打折。
-
工具链闭环层:cuDNN(深度学习原语)、cuBLAS(矩阵)、TensorRT(推理编译)、NCCL(多卡通信)、cuSPARSE(稀疏)——每个都是十余年打磨的精品,组合成"调优即写CUDA"的潜规则。
-
网络效应层:开发者多→库多→框架适配好→新开发者继续学CUDA。这个飞轮转了20年,已近临界速度。
-
切换成本层:企业买非N卡,第一件事是花数百万重训工程师、重写流水线、承担良率与社区支持损失。"用了难离"不是形容词,是财务报表。
智库判断:CUDA护城河的本质不在代码,而在人——450万开发者、10万优化算子、20年Stack Overflow问答沉淀,才是黄仁勋真正的资产。
二、 护城河正在从"静态"变"动态"
II. The Moat Is Shifting from "Static" to "Dynamic"
2023年到2026年,一道关键裂缝出现:推理占AI算力消耗比重从约1/3升至约2/3。
From 2023 to 2026, a key fissure appeared: the share of inference in AI compute consumption rose from ~1/3 to ~2/3.
-
训练是"少数超算中心+长周期+CUDA深度定制",CUDA壁垒最硬;
-
推理是"海量边缘/企业节点+成本敏感+负载静态+标准化框架",恰恰是CUDA最薄弱的一段。
-
推理对先进制程依赖较低,至强AMX、Gaudi、ROCm、Ascend均可分一杯羹。2025年英伟达在中国AI加速卡出货份额约55%,机构预测2026年萎缩至8%,华为昇腾升至50%——流失的全是推理与中低端训练。
这意味着CUDA护城河并未崩塌,但性质变了:从"全栈不可逾越"变成"训练端仍垄断、推理端被蚕食"的动态均衡。

三、 开放阵营的四路打法
III. The Four Prongs of the Open Camp
1. AMD ROCm:从"兼容CUDA"到"上游化"
ROCm早年被嘲"装不上、调不通"。但到ROCm 7(2026),态势已变:
-
PyTorch主分支原生合入ROCm后端,不再需特殊编译;vLLM、SGLang、llama.cpp、Ollama、ComfyUI开箱即用。
-
hipify工具把
.cu转.hip,官方宣称>90%自动迁移;不涉及手写PTX的AI代码改两行import即可跑在MI300X。 -
ROCm.ai(2026.8发布)叠加AI辅助排障,把"可用"推向"好用"。
-
成本侧:MI355X在GLM-5 FP8单机推理上比B200便宜约40%(SemiAnalysis数据),软件差距从"代差"缩到"调优差"。
局限:分布式训练、FP4推理、NVLink级机内互联仍是N卡优势;手写CUDA内核(<5%但关键)仍需人工移植。
2. Intel oneAPI + OpenVINO:绕过GPU,重定义战场
Intel不正面拼训练GPU,而是把战火烧到CPU推理+边缘+开放标准:
-
至强AMX:4/5代至强内置矩阵单元,INT8/BF16推理无需买卡,存量服务器软件升级即得AI能力,双路至强可跑7B—13B模型数百QPS。
-
Gaudi 3:24×200GbE原生以太网,scale-up=scale-out,用标准以太网替代NVLink,集群扩展不改代码。
-
OpenVINO:模型优化+量化+多后端(CPU/iGPU/NPU/Gaudi),是Intel最成熟资产,年下载破百万。
-
oneAPI/SYCL:跨CPU/GPU/FPGA统一编程,投UXL基金会(Arm/高通/三星加盟),明确对标"去CUDA化"。
打法本质:不抢CUDA的训练皇冠,抢它推理侧的存量企业市场。
3. 华为CANN + 昇腾:地缘裂变出的第二生态
2025年华为宣布CANN全面开源(算子/通信/运行时),昇腾950PR跑通DeepSeek V4万亿参数训练"零CUDA行"。
-
中国AI加速卡2025年出货400万张,国产占41%(四年前<5%),英伟达中国份额从95%跌到54%。
-
走"超节点+集群补单点"路线,CANN定位与CUDA同构但开源,形成全球AI生态分裂的最现实变量。
4. 框架上游化 + AI写AI:看不见的第三战场
-
PyTorch基金会中立化,ROCm、XLA、OpenXLA、TorchInductor把硬件后端抽象掉——开发者写
torch.compile而非写CUDA,硬件绑定被框架层稀释。 -
Anthropic案例:Claude一个周末帮工程师把主力模型适配到AMD硬件;DeepSeek用TileLang高级语言重写算子,AI辅助编译器正在把"20年人工积累"压缩成"数月自动迁移"。
-
当"迁移"本身被AI自动化,CUDA的人力沉淀壁垒首次出现技术性贬值。
四、 为什么CUDA仍难被取代(短期)
IV. Why CUDA Remains Hard to Replace (Short Term)
开放阵营进度惊人,但三个刚性优势仍在:
-
分布式训练闭环:NVLink(900GB/s双向)+ NCCL + CUDA Graph + TensorRT-LLM,在千卡/万卡训练上仍比以太网方案省30—50%通信开销。
-
极端性能场景:FP4推理、MoE专家并行、长上下文KV Cache调度,N卡+CUDA仍是默认最优解。
-
企业采购惯性:AI Enterprise软硬打包、合规认证、厂商责任边界,使金融/医疗/自动驾驶头部客户不敢轻易双源。
2026年现实格局:全球高端训练市场N卡仍>90%;推理与边缘市场进入"N卡+AMD+Intel+Ascend"四分式;中国市场因出口管制提前分裂为双生态。
五、 开放之战的终局:不是推翻,是分层V. The Endgame of the Open War: Not Overthrow, but Stratification
此文由 怡心湖 编辑,若您觉得有益,欢迎分享转发!:首页 > 常识论 » CUDA的护城河与AI生态的开放之战 CUDA’s Moat and the War for an Open AI Ecosystem
后GPU时代的基础设施之争:英特尔AI
CANN vs CUDA:残余 10% 坑位清单(PyT
硅、栈与主权:AI 时代中国 GPU 国产