
埃隆·马斯克上月下旬在X平台披露,位于孟菲斯附近的AI训练集群“Colossus 2”已部署11万颗英伟达GB200芯片和44万颗GB300芯片。另有22万颗GB300芯片将于下周上线,11月及12月底若进展顺利,将各追加22万颗。届时,该站点英伟达先进处理器总数将突破120万颗。
这一建设速度远超传统数据中心时间表,凸显了AI行业对算力的迫切需求。最初的Colossus设施利用前伊莱克斯工厂改建,仅用122天便上线并配备10万块H100 GPU,随后92天内规模翻倍。该项目已从Grok的内部训练资源转型为商用超级计算机,扩张正在加速。
电力瓶颈与能源方案
电力供应仍是主要制约因素。孟菲斯集群IT负载已达约1吉瓦,其中Colossus 2消耗946兆瓦,包含冷却等开销的园区总用电量有时超过1.2吉瓦。现场依靠临时燃气轮机和数百台特斯拉Megapack储能电池供电。高管称,该系统拥有约2,000兆瓦用户侧存储容量和3.3吉瓦时电量,可为整个孟菲斯市供电两小时,是全球最大的并网电池系统。
然而,因噪音、排放及社区投诉,监管机构已下令在2027年中前淘汰69台临时燃气轮机。为此,一座1.2吉瓦的燃气电厂正在州界对面的密西西比州南黑文建设,预计将在燃气轮机退场同期全面上线,以提供稳定基荷电力。这一拼凑式供电方案已引发环保组织诉讼及参议员质疑。
巨额投入与商业回报
Epoch AI估计,Colossus 2目前已投入资本358亿美元,若完成全部建设,成本可能高达580亿美元。这些费用涵盖芯片、网络、电力基础设施及多个站点建筑。由SpaceX与xAI合并而成的SpaceXAI负责运营该站点。
硬件投入已开始产生回报。谷歌今年6月签署了一项涉及约11万块GPU的交易,从2026年10月至2029年6月每月支付9.2亿美元,合同总额超300亿美元。Anthropic也预订了大量算力,月费率接近12.5亿美元。此外,一家未披露客户自12月起每月承诺支付11.1亿美元。结合其他托管协议,孟菲斯运营中心的年度经常性收入潜力接近1,000亿美元,成为马斯克投资组合中最大的经常性收入来源之一。
速度与风险并存
马斯克团队通过利用棕地项目、现场发电和激进采购策略,将传统需数年完成的吉瓦级设施建设压缩至数月。英伟达指出,原始Colossus的第一组机架仅在19天内安装完毕并运行训练任务。
但这种模式伴随风险。除监管阻力外,居民抱怨噪音和空气质量,炎热气候下的冷却用水也给市政带来压力。尽管如此,Colossus 2性能指标强劲:目前拥有111.2万个H100等效加速器,每秒执行2.2e21次八位运算。预计到2027年初,该站点将扩展至180万个H100等效加速器,IT功率达1.5吉瓦。
最后一批22万颗芯片能否在12月前到位,取决于光纤网络、电力稳定性和供应链状况,马斯克对此表示“如果我们运气好”。目前看来,团队正全力克服障碍。孟菲斯项目以前所未有的规模将算力稀缺理论转化为现实,确立了AI竞赛的新节奏,迫使其他实验室和云服务商竞相追赶。