数据中心基础设施初创公司 Clockwork Systems 宣布完成 3100 万美元新一轮融资,并推出新功能 TorchSnap,旨在最小化计算资源浪费,提升人工智能芯片集群效率。本轮由 Seligman Ventures、Wing Ventures 和 Premji Invest 联合领投,原有投资方 NEA 和 e& Capital 继续跟投。至此,该公司累计融资额达 7300 万美元。

破解 GPU 集群故障痛点

随着 AI 算力成本攀升,企业关注点已从获取原始 GPU 资源转向最大化集群利用率。在数千块 GPU 的大型分布式工作负载中,硬件故障已成常态。以 Meta 训练 Llama 3 模型为例,其 16,384 块 GPU 集群平均每三小时报告一次硬件问题。

传统恢复方式需从快照重新加载进度,耗时可达 90 分钟,导致大量正常 GPU 闲置并重复执行已完成工作。Clockwork 通过位于 GPU 与工作负载之间的可编程软件层,提供纳秒级精度遥测数据,在集群重启前识别潜在问题。

Clockwork CEO Suresh Vasudevan 表示,容错能力是有效产出(goodput)的倍增器,确保 GPU 持续进行有用工作而非等待恢复。新推出的 TorchSnap 在现有 LinkPass 网络故障转移和 TorchPass GPU 迁移工具基础上,增加了第三道保护屏障。该功能无需修改代码即可捕获多节点快照,支持任务从断点快速重启,并通过应用层“检查点逻辑”减少进度损失。

头部客户已规模化部署

SemiAnalysis 分析师 Dylan Patel 指出,集群容错已从训练阶段延伸至推理阶段,Clockwork 能在链路波动期间保持服务,加速权重回传。

自上一轮融资以来,Clockwork 软件在公共云、新型云服务商及企业中快速落地。微软旗下 LinkedIn 已在全队 GPU 中部署 LinkPass,每月消除数千小时停机时间,确保 AI 流量绕过光纤链路和交换机故障。Together AI 将 TorchPass 作为服务提供给客户,新型云提供商 WhiteFiber 则利用该技术审计集群可靠性。

NEA 风险合伙人 Greg Papadopoulos 评价称,GPU 最显著的特点是其不可靠性,而 Clockwork 的软件层正成为 AI 集群不可或缺的基础设施,取代了传统的停止作业并重新加载检查点的低效策略。