
自2020年以来,人工智能领域的主导叙事一直是训练更大、更强的模型。大型语言模型(LLM)的参数规模从百万级膨胀至万亿级,这一策略成效显著:OpenAI于2020年发布的GPT-3在知识与推理基准测试中的正确率仅为43.9%,而四年后的GPT-4o得分已达88.7%,媲美人类专家水平。
然而,到了2026年,前沿焦点已发生根本性转移。尽管顶尖实验室仍在训练巨型模型,但“推理”——即利用已训练模型生成代码、文本或图像的过程——已成为行业核心。Moor Insights & Strategy首席分析师Matt Kimball指出:“训练已是昨日黄花,首席信息官们现在只关心推理。”英伟达CEO黄仁勋在GTC 2026大会上也将此称为“推理的拐点”。
这一转变源于LLM实用性的爆发。随着“思维链”技术和智能体AI的兴起,模型不再仅对用户查询进行单次响应,而是通过多次自我提示和全天候自主工作来完成任务,导致推理负载激增。高推理投入模型生成的文本量可达普通模型的20倍,进而引发了科技巨头间意想不到的联盟与硬件架构的深刻重构。
推理与训练的本质差异
AI训练如同在数十亿文本上进行大规模的“猜谜游戏”,通过反向传播反复调整参数,计算密集且需要庞大数据中心支持。一旦训练完成,参数冻结,模型进入推理阶段。
推理过程分为“预填充”(prefill)和“解码”(decode)两个阶段。预填充阶段,模型并行处理提示词,计算词元间的注意力关系,这与GPU擅长的图形渲染类似,易于并行加速。但在解码阶段,模型需自回归地逐个生成词元。每生成一个新词元,都必须从内存中读取整个模型权重及不断增长的KV缓存(关键值缓存)。
这种串行特性使得内存带宽成为主要瓶颈。研究发现,运行开源LLM的英伟达H100 GPU有50%至80%的时间处于空闲状态,等待数据从内存传输至计算单元。正如AI初创公司d-Matrix创始人Sudeep Bhoja所言,推理的挑战在于“读取所有权重和上下文”,而非单纯的计算。
内存瓶颈催生架构创新
为解决内存墙问题,行业出现了多种技术路径。Meta前硅工程主管Shahriar Rabii创立的Majestic Labs和Bhoja创立的d-Matrix均摒弃了昂贵的高带宽内存(HBM),转而使用更廉价的DRAM,但采取了截然不同的策略。
d-Matrix的第二代加速器Raptor采用堆叠架构,将逻辑芯片直接堆叠在DRAM之上,将数据传输距离缩短至微米级,从而大幅提升带宽。相比之下,Majestic Labs致力于扩展内存接口的物理距离,通过专有铜链路和聚合芯片,使内存连接距离从几毫米延伸至一米。这使得单个服务器机架可支持高达128TB的DRAM,远超英伟达GB300 NVL72机架约20TB的HBM容量。
与此同时,传统内存巨头也在演进。SK海力士表示,预计2026年下半年出货的HBM4内存将通过翻倍带宽和增加堆栈容量,进一步缓解推理瓶颈。
巨头的混合芯片策略
面对推理负载的复杂性,英伟达和亚马逊AWS均采取了“组合拳”策略,将不同特性的芯片搭配使用。
英伟达在2025年底以200亿美元收购Groq的关键人才和知识产权后,于GTC 2026发布了Groq 3语言处理单元(LPU)。LPU内置500MB片上SRAM,内存带宽是GPU的七倍,专为处理解码阶段的矩阵乘法而设计。英伟达计划将Vera Rubin GPU用于计算密集的预填充阶段,而将Groq LPU用于内存密集的解码阶段,以实现性能最优。
亚马逊AWS则选择与Cerebras合作,将其Trainium芯片与Cerebras的晶圆级引擎3(WSE-3)配对。WSE-3将整个硅晶圆制成单一芯片,集成44GB SRAM,能够直接在芯片上存储模型权重。OpenAI已部署WSE-3驱动其编码模型,每秒输出超过1000个词元,远超标准部署的速度。AWS同样利用Trainium处理预填充,Cerebras处理解码。
软件优化与专用硅片的崛起
除了硬件架构,软件层面的量化技术也在推动推理效率提升。通过将模型从高精度格式转换为4位格式(如英伟达的NVFP4或AMD、Intel支持的MXFP4),可在几乎不损失精度的情况下显著提升性能。英伟达数据显示,将DeepSeek-R1量化为NVFP4后,性能提升了三倍,而基准测试得分下降不足1%。
更激进的创新来自初创公司。Tensordyne利用对数数系,将乘法运算转化为加法,其Napier芯片功耗仅为同类英伟达硬件的十分之一,预计2027年可用。另一家初创公司Etched则设计了专门针对Transformer架构的专用芯片Sohu,通过硬连线连接方式,以牺牲通用性为代价,实现了每秒50万个词元的惊人推理速度。
尽管技术路线多样,但共识已然形成:AI推理的未来不属于单一芯片,而是异构系统的协同。随着智能体AI的普及,推理需求将持续增长,推动硬件创新在多条战线上同时推进,正如当年CPU的发展历程一样。