
AI推理正迅速成为重塑AI经济格局的关键工作负载。尽管训练需求推动了早期GPU云基础设施的建设,但如何以更快速度、更低成本提供模型服务,将定义行业发展的下一阶段。这一趋势促使专业云服务提供商超越单纯的GPU算力供给,向存储、网络及软件领域延伸。CoreWeave产品与AI服务副总裁Urvashi Chowdhary表示,公司正基于其基础设施构建涵盖训练、后处理和推理的全栈管理服务层。Chowdhary指出,AI开发者旨在以最佳性能和可扩展的成本尽快解决问题。因此,CoreWeave专注于在可靠的基础设施之上,为训练、后处理及推理等环节构建更多管理服务。逐层优化推理性能
推理需求呈现爆发式增长。调查显示,某医疗客户的推理工作负载占比在第一年约为10%,第二年升至40%,预计未来12个月内将达到约50%。对此,CoreWeave的策略是从硬件之上的每一层进行调优,包括整合vLLM引擎、量化模型以及自定义推测解码器。
“我们有意利用并回馈开源社区,确保客户拥有灵活性,并在此基础上构建相互关联的服务。”Chowdhary说。
强化学习(RL)带来的部署压力尤为显著。当客户使用奖励和验证器训练智能体模型时,推理往往成为瓶颈。CoreWeave推出的RL Rollouts功能基于Nvidia Dynamo框架预览版,可将新检查点加载到实时部署中。测试显示,与基线配置相比,该功能将模型重新加载延迟缩短了15倍。
Chowdhary解释称,RL部署需要不断创建新的模型检查点并独立扩展推理规模。速度提升15倍意味着在保持快速训练的同时,推理能力也能同步扩展。
上述功能已集成至 newly released CoreWeave Forge平台。该平台连接了模型服务、可观测性、后处理和评估功能,并提供免费起步方案及付费层级,旨在降低个人开发者使用领先AI技术的门槛,确保其在无需妥协性能和可靠性的前提下进行开发。