AMD 宣布将在未来四年内投入 820 亿美元,战略重心从单纯的语言模型军备竞赛,转向能够理解物理世界的多模态人工智能系统。这一举措标志着 AMD 试图摆脱对纯文本处理的依赖,转而聚焦于结合视觉、机器人技术、仿真及实时传感器数据的“具身智能”领域。

战略转向:从文本到物理世界

行业分析指出,尽管大语言模型在文本预测上表现优异,但在操作物体、预测物理结果等实际任务中已显现收益递减趋势。AMD 认为,智能源于与环境的互动,而非仅靠统计网络文本模式。因此,新战略旨在开发一类以三维世界为主要训练数据的基础模型,要求芯片在低延迟传感器融合、高分辨率空间注意力及持续在线学习方面具备更强性能,而非仅仅追求令牌吞吐量。

为实现这一目标,AMD 正对其 Instinct MI400 系列加速器进行重新架构,采用更密集的矩阵引擎以优化视觉变换器和图神经网络,并提升内存带宽以应对机器人平台产生的海量数据流。软件层面,ROCm 栈将原生支持 MuJoCo 和 Isaac Sim 等物理引擎,助力开发者实现从仿真到真实硬件的低损耗迁移。

820 亿美元资金拆解

这笔巨额投资将被划分为三个主要支柱:

  • 350 亿美元用于定制硅片开发,包括研发带有集成光子接口的下一代 3D 堆叠加速器,以实现低延迟传感器连接;
  • 250 亿美元用于战略性收购,以及与机器人公司、仿真企业和学术实验室的合作;
  • 220 亿美元支持全球数据采集基础设施建设、软件工程团队扩张,以及结合神经网络与显式物理引擎的神经符号架构长期研究。

在数据层面,AMD 不再单纯抓取互联网文本,而是通过与机器人实验室、自动驾驶车队及工业自动化站点合作,构建包含同步视频、深度、音频和力矩数据的大规模多模态预训练语料库。这些数据帧将携带物体属性、表面摩擦、光照条件及因果关系等精确标签,旨在训练出具备真正物理直觉的模型。

竞争格局与技术挑战

此举被视为 AMD 对抗 AI 商品化风险的必要保险,同时也意在避免在由英伟达、谷歌 DeepMind 及 Figure AI 等主导的物理 AI 竞争中沦为单纯的组件供应商。英伟达已通过 Project GR00T 和 Omniverse 布局该领域,而初创公司也在筹集巨资构建通用人形机器人。

然而,技术挑战依然严峻。物理模型训练所需的计算量远超语言建模,且需处理 PB 级异构数据的实时跨模态对齐。此外,“仿真到现实”的迁移难题、安全保障复杂性以及数据隐私问题,均为潜在风险点。批评人士警告,若高保真世界模型的计算需求超出硬件改进速度,该方法可能在经济上不可行。

AMD 高管反驳称,无限扩展语言模型面临高质量数据耗尽的风险,而物理世界提供了近乎无限的训练信号。实施计划分阶段进行:前两年专注基础硬件和数据管道构建,后两年侧重世界模型缩放定律及高效推理技术开发。预计到四年期结束时,AMD 将提供从消费级紧凑版到工业级庞大系统的一系列世界模型基础模型。

早期演示已显示初步成果,如原型系统能根据外观推断包裹重量并调整抓握力,或预测抽屉快速开启时的物体倒塌情况。若成功,AMD 有望在预计于 2030 年代爆发的物理 AI 市场中占据领先地位,并将影响力扩展至材料科学、气候建模及手术机器人等科研与医疗领域。