弱化英伟达市场优势 AI算力架构上演“三英战吕布”
AI注定成为2020年代全球半导体产业最重要的主题,借助AI算力需求的爆发,英伟达从一家2019年营收仅109亿美元、市值不足1500亿美元的公司,迅速成长为拥有超过5.5万亿市值的全球第一,公司年营收接近2200亿美元。亮眼数据的背后,是英伟达软硬件体系在AI算力架构中的绝对领导地位。
面对英伟达如此强势的市场地位,以英特尔、AMD和谷歌为首的处理器三巨头希望通过革新AI算力架构的设计体系,弱化英伟达市场地位,在AI应用从训练向推理应用过渡期抢回AI算力架构的控制权。
虽然英特尔和AMD在PC处理器市场斗了20多年,但是当x86生态遇到挑战时,两家屡次携手捍卫x86处理器的市场领先地位,从共同打破Power架构垄断到携手构建x86生态迎接Arm挑战,如今双方再一次携手致力于强化x86处理器在AI算力架构的统治地位。
长久以来,人工智能硬件领域的讨论焦点始终围绕GPU展开,CPU 反倒沦为次要备选,即便是随着AI推理应用的普及再一次引爆了CPU的市场需求,但是在AI算力架构体系中,英伟达自研的Vera处理器和Arm的AGI处理器似乎比x86处理器更符合AI负载的处理需求。
为了重塑x86处理器在AI算力体系的核心地位,英特尔与 AMD 推出一套全新面向处理器的技术规范,试图重新平衡CPU和GPU之间的二者的算力定位。此次合作释放明确信号:两家厂商均认定,在特定机器学习任务场景下,CPU特别是x86 CPU仍有巨大性能提升空间。
这套规范全称为AI 计算扩展(AI Compute Extensions,简称 ACE),可为 x86 处理器提供一套高效执行 AI 运算的标准化方案。其定位并非替代大规模训练场景中的 GPU,而是面向轻量模型、低延迟任务,以及无独立显卡、搭载显卡得不偿失的硬件系统。这一点的实际价值远超表面看上去的程度。CPU 与 GPU 之间的数据双向传输存在固定性能开销;对于需要即时响应、硬件资源受限的业务负载,数据反复搬运极易形成性能瓶颈。而将全部计算任务交由 CPU 本地执行,则能彻底规避该问题。
从底层技术原理来看,ACE 架构以矩阵乘法运算为核心 —— 矩阵乘法是绝大多数 AI 算法的基础计算单元。传统 CPU 虽能完成此类运算,但执行效率偏低。行业此前依靠 AVX 向量指令弥补短板,但这套指令集在设计之初并未针对矩阵密集型运算做优化。ACE 采用全新优化思路:保留现有 AVX10 寄存器架构,同时新增专用矩阵运算硬件单元。该设计无需开发者更换全新数据格式或编程模型,核心亮点包含三大维度:能效表现显著提升、开发与调优门槛降低、兼容 AVX 原生 512 位输入位宽。依托 512 位通用输入,ACE 无需定制专属数据输入格式,仅需少量改动即可兼容现有软件与硬件开发流程。
性能提升在指令执行层面体现最为直观:处理同等输入向量时,ACE 可并行执行的运算量最高可达 AVX10 的 16 倍,这并不代表应用运行速度会直接提升 16 倍,实际落地性能受多重因素制约,但该特性可大幅提升指令执行效率,同步降低功耗、减轻内存带宽占用压力。可以预见,英特尔、AMD 会在后续处理器设计中分配更多硬件资源给该运算单元,进一步拔高算力。除此之外,单条 ACE 指令可完成远超同等 AVX10 循环指令的计算量,直接减少 CPU 指令调度开销,同步优化内存带宽利用率。这种特性让能效优化成为ACE最具实用价值的优势之一。GPU算力强劲,但功耗极高,且额外的数据传输会叠加性能损耗。对比之下,由CPU直接承载AI运算的方案能效更优,尤其适配边缘终端、单人终端软件等场景。

图 ACE架构的核心内容汇总图
ACE 架构另一核心设计亮点是跨厂商一致性。该规范不绑定任何厂商专属硬件实现,大幅降低开发者适配 PyTorch、TensorFlow 等主流 AI 框架的成本。开发者无需针对不同 AVX 版本编写多套分支代码,仅需面向统一标准开发即可。该扩展指令集全面覆盖机器学习主流数据格式,包括 INT8、INT32、FP8、FP16、FP32、BF16;同时原生支持开放计算项目(OCP)推出的 MX 分块缩放数据格式,该格式并未纳入 AVX10 指令集。丰富的数据格式兼容能力,适配当下多样化的模型部署需求,推理场景受益尤为明显。
在异构计算层面,ACE 还有一项不易察觉的优势:目前 NPU 虽逐步普及,但行业尚未形成统一标准,将任务迁移至 NPU 会因硬件差异衍生各类适配难题。当业务对响应速度、开发简洁性的需求高于极致算力时,ACE 提供了稳定可靠的 CPU 本地运算方案。
上述所有技术革新,均不会动摇 GPU 在大规模 AI 训练场景中的核心地位,当下超大规模训练集群依旧高度依赖专用加速卡。但 ACE 清晰证明:CPU 在人工智能赛道的架构演进并未止步。依托全新架构优化,CPU 可承接范围更广的 AI 业务负载,部分场景下甚至能交出更优的运行表现。
谷歌TPU要挑战英伟达商业模型
除了英特尔和AMD之外,英伟达面对的另一个强劲对手是手握云资源和TPU的谷歌。随着AI推理应用对效率要求越来越严格,谷歌的自研张量处理器(TPU)已经成长为英伟达的真正竞争对手。过去很长一段时间,谷歌研发 TPU 主要供给自身内部业务,依托这套芯片承载搜索、语音识别等内部高负载 AI 运算。而现在,谷歌计划把内部算力优势转化为对外商业化业务,直接与英伟达同台竞争。
这场战略转向的典型案例,是坐落于纽约州西部安大略湖南岸、尼亚加拉瀑布附近一座名为 “马林湖” 的 AI 数据中心集群。据《华尔街日报》知情人士透露,谷歌母公司 Alphabet 已为该项目出具 32 亿美元资金担保;项目开发方计划向 Anthropic 出租算力,所用硬件正是上万块谷歌自研 TPU。整套商业逻辑与英伟达如出一辙:为数据中心项目提供融资支持,后续机房采购自家芯片时实现收益回流。
行业分析机构 SemiAnalysis 在去年 11 月研报中抛出疑问:Anthropic 训练大模型所使用的谷歌第七代 TPU,是否会终结英伟达一家独大的格局?谷歌近期一系列动作,显然意在验证这一猜想。公司刚与黑石集团达成 50 亿美元合作,合资成立全新云服务商,对标 CoreWeave、Nebius 这类深度绑定英伟达生态的云厂商。同时谷歌调整销售策略,不再仅通过云平台对外提供算力,改为直接向客户售卖 TPU 芯片,并推出首款专为 AI 推理场景设计的 TPU 新品。
反观英伟达,并未将 TPU 视作足以动摇根基的威胁。依托 CUDA 软件生态与成熟硬件配套体系,英伟达依旧占据全球 AI 芯片市场超九成份额,绝大多数 AI 实验室都深度依赖其产品。不过,部分云服务商陷入英伟达生态绑定困境,他们担忧一旦削减英伟达采购份额,就难以拿到紧俏的高端 GPU。贝西默风投合伙人亚当・费舍尔透露,不少业内口中的 “新兴云厂商” 都深陷行业半开玩笑所称的 “黄仁勋牢笼”。他表示:“并非所有绑定英伟达的新兴云厂商都会直言痛点,部分企业会称英伟达能满足全部需求;但还有大量厂商迫切寻找替代方案,却找不到第二家稳定供货的芯片供应商。”
谷歌正以巨额资金与战略倾斜打破行业固有格局。公司宣布计划募资 850 亿美元股权融资,资金主要用于扩建 AI 算力基础设施。除马林湖项目外,谷歌还为路易斯安那州巴吞鲁日附近另一座服务 Anthropic 的 “河湾” 数据中心项目背书,项目总投资 70 亿美元;同时为得克萨斯州科罗拉多城一处 AI 算力租赁项目提供 14 亿美元担保。
随着全球 AI 算力供给持续收紧,这类配套融资模式的重要性愈发凸显。过去一年,AI 赛道竞争的核心早已从模型研发转向算力资源争夺。谷歌内部,TPU 业务战略地位大幅提升。去年 12 月,阿明・瓦赫达特出任公司 AI 基础设施建设首席技术官,全盘统筹 TPU 芯片设计、供应链与落地部署,他的核心任务就是全力推动自研芯片持续迭代性能、落地清晰商业化目标。瓦赫达特称,谷歌并非要颠覆英伟达的行业龙头地位。谷歌自有数据中心仍在采购英伟达 GPU,双方属于竞争与合作并存的关系。“对我、对谷歌而言,这从来不是一场零和博弈,当下市场算力需求体量巨大,足以容纳多方玩家。”
全球 AI 业务负载增速远超单一厂商的供给上限,这正是谷歌突围的窗口期。若谷歌持续迭代 TPU 性能、锁定 Anthropic、城堡证券等长期大客户,同时依托雄厚资金助力合作伙伴扩建算力机房,TPU 将不再只是谷歌内部自用工具,有望在英伟达一家独大的市场中,成为行业真正成熟的第二选择。












评论