
从GPU时代迈向异构AI工厂
人工智能基础设施的演进已跨越单一图形处理单元(GPU)或芯片架构的定义阶段。计算、内存、网络、封装、电源及软件正融合为全新的系统架构,“主权”成为这一转型的必然结果。
半导体行业正步入AI建设的新阶段,市场可能仍低估了此次架构变革的深度。在生成式AI发展的初期,焦点集中于作为稀缺资源的GPU,英伟达因此成为该周期的定义者。然而,当前的重心正从芯片向系统扩散。
如今的讨论已转向包含CPU、GPU及定制加速处理器(XPU)、高带宽内存(HBM)、扩展网络、芯粒(Chiplet)、先进封装、光器件、冷却系统及电力在内的整体系统。AI工厂本身正在演变为计算机。
近期,超微半导体(AMD)首席技术官马克·帕珀马斯特、博通半导体负责人查理·卡瓦斯、三星电子Paul Cho以及OpenAI硬件负责人Richard Ho等业界领袖指出,AI正迫使行业重新设计计算机及其制造方式。“单一处理器架构通吃”的模式已难以适配训练、推理、智能体(Agents)等差异化工作负载。
帕珀马斯特表示,通用CPU和GPU不会消失,但模块化架构和芯粒技术允许供应商在保留共同基础的同时,针对特定负载创建变体。例如,AMD的Venice设计正针对新兴的智能体工作负载进行定制。
另一方面,定制加速器主要面向少数具备大规模运营能力的前沿AI公司。卡瓦斯指出,定制硅片需要足够的工作负载、软件栈所有权及可预测的需求以分摊成本。谷歌TPU、亚马逊AWS的Trainium和Inferentia、微软Maia以及Meta的内部加速器均属此类。OpenAI亦通过与博通合作推出Jalapeño架构,针对关键的内核、内存移动和网络交付模式进行全栈优化。
内存走向架构前台
内存正从计算机架构的后端移向前台。传统架构通常先设计计算系统再附加内存层级,但AI的海量参数和数据移动使得内存带宽、容量、功耗及物理距离成为决定性能的关键。
三星电子Paul Cho指出:“内存不再是AI基础设施中的配角,它正成为设计的中心。”行业焦点已转向逻辑、内存和封装的协同设计,包括HBM认证和3D集成内存。AI基础设施竞赛已演变为一场数据移动竞赛。
信息在电路板、机架或数据中心间的传输消耗时间与能源,这推动了计算、HBM、先进封装和高速互连的激进集成。若说第一代AI基础设施的瓶颈是加速器,那么HBM和先进封装证明了瓶颈是动态移动的。
瓶颈时钟不断推移
AI领域不存在永久的瓶颈,只有不断推移的“瓶颈时钟”。随着GPU产能响应,瓶颈随后转移至HBM、封装、网络、Transformer模型复杂度及电力容量。接着,冷却、土地和许可问题进入考量范围。
当前,先进封装、大基板、内存认证、3D集成和热管理已成为架构层面的关键约束。对于科技行业和投资者而言,仅关注GPU出货量已无法准确反映AI基础设施的上線速度。核心指标已转变为供应链交付功能性智能生产单元的整体速度。
电力成为架构的一部分
电力是未来AI系统的核心约束之一。帕珀马斯特强调,这凸显了芯粒、2.5D/3D封装、光子学、热管理及软硬协同优化的重要性。
行业规划正超越单机架思维,转向吉瓦(GW)级集群和园区。训练环境耗电达数吉瓦,未来园区功耗可能在5至10吉瓦之间。在此规模下,“数据中心”一词已不足以概括,这些实质上是消耗电力、数据和硅片以制造Token和智能的工业系统。
能源成为智能生产的投入要素:电力→计算→Token→智能→经济价值。每瓦性能成为AI时代的定义性指标,几个百分点的效率提升意味着巨额的资本节省。
AI开始设计下一代AI工厂
更深层的变化在于,AI开始辅助设计半导体基础设施本身。OpenAI的Jalapeño开发项目利用AI模型加速设计和优化,将从设计到生产流片的时间压缩至约9个月。Richard Ho表示:“模型赋予了工程师超能力。”
但这并非取代工程师,而是扩大其可探索的设计空间。耗时过多的架构替代方案变得可行,验证周期缩短,软件开发加速。这形成了一个反馈循环:AI设计出更好的芯片,构建更高效的AI工厂,进而孕育更强的AI。这种复利效应可能比单一的半导体工艺节点改进更具决定性。
下一个时代可能是传统摩尔定律与“工程速度定律”的结合。能够更快运行设计实验、验证并集成软硬件的组织,将在晶体管迭代之前获得优势。
系统成为新的价值单位
下一波性能增益将源于系统级创新。性能提升来自制程技术、芯粒、定制硅片、HBM、先进封装、网络、光学、冷却、软件和电源工程的组合协调,而非单一的半导体突破。
这解释了英伟达的机架级战略、AMD向完整AI系统的扩展、博通定制硅片与网络的组合优势,以及三星、SK海力士和美光等内存供应商在架构对话中地位的提升。戴尔、Supermicro和惠普企业(HPE)等系统厂商的机会,也在于实现AI工厂的工业化。
主权进入对话
随着AI工厂成为战略性工业基础设施,“谁控制它”的问题愈发关键,“主权AI”概念应运而生。早期的主权讨论聚焦于数据驻留,但现在延伸至对硅片、内存、网络生态系统、云控制平面及模型提供商的依赖管理。
主权并非自给自足,而是理解并控制关键依赖关系。Cho强调,应在设计早期将内存、第二来源和合格地理区域纳入架构考量。以太网可选性、定制与商用硅片的选择、能源及模型供应均涉及此原则。
拥有数千个GPU并不等同于拥有智能基础设施的控制权。必须区分“GPU主权”与“AI主权”。
竞赛从芯片转向智能生产
AI竞争的单位正日益成为整个智能生产系统。这不仅是GPU或大语言模型的竞争,更是系统的竞争。
AI工厂与主权AI在此交汇:前者是制造智能的物理和计算系统,后者关乎控制权、关键依赖性及经济模式。半导体路线图正演变为更宏大的战略图谱。第一阶段是为模型和GPU的竞赛,下一阶段则是构建最高效、可扩展且具韧性的智能生产系统的竞赛。关于谁能建造、运营并控制这一系统的战斗,才刚刚开始。