
埃隆·马斯克的“巨神”(Colossus)超级计算机愿景正加速落地。自近两年前宣布将集群扩展至超百万GPU以来,这一目标已近在咫尺。马斯克在X平台透露,下周将有22万颗英伟达GB300 GPU投入运营,另有22万颗将于11月上线;若进展顺利,年底还将新增22万颗。
新增算力将叠加于现有基础设施之上:Colossus 2数据中心已运行11万颗GB200和44万颗GB300;Colossus 1数据中心则部署了15万颗H100、5万颗H200及3万颗GB200。届时,SpaceX AI旗下的GB300总数将达110万颗,运行GPU总量突破144万颗。鉴于SpaceX AI成立仅三年,而竞争对手Anthropic和OpenAI分别已有六年和十年历史,这一扩张速度尤为显著。
混合架构与电力挑战
由于采用Hopper和Blackwell混合架构的Colossus 1在训练Grok模型时效率较低,马斯克已将其出租给Anthropic用于推理任务;而全Blackwell架构的Colossus 2则确保了性能瓶颈最小化。
相比硬件获取,电力供应成为当前数据中心建设的更大瓶颈。SpaceX AI选择自建电源,但因未经许可运行燃气轮机引发社区争议并遭起诉。对此,SpaceX承诺将在一年内移除相关设备,待自有1.2吉瓦发电厂上线后完成过渡。
从地面到轨道的野心
单站点百万GPU规模虽属行业领先,但并非孤例。博通曾指出,已有三家超大规模客户计划在2027年前实现类似规模。对马斯克而言,这仅是起点:他计划到2027年将数据中心容量扩大七倍,并设定了2030年拥有5000万颗H100等效GPU的宏大目标。
此外,SpaceX还构想发射由百万颗卫星组成的“轨道数据中心系统”。不过,英伟达CEO黄仁勋目前仍将这一设想视为“梦想”。