新型AI云基础设施提供商QumulusAI发布由Futurum Research撰写的最新报告指出,与传统简单推理调用相比,智能体(Agentic)AI可将单任务Token消耗量提升10至100倍。随着应用进入生产环境并在企业级规模扩展,这种激增将使依赖按Token计费模式的组织面临不可预测且不断攀升的成本风险。

混合策略重掌成本控制

题为《摆脱按Token计费:企业如何通过预留裸金属基础设施重掌AI成本控制》的报告建议,企业应采用混合策略,将成熟的生产工作负载从按Token计费迁移至预留基础设施,以应对迅速增长的AI推理成本。该报告基于Futurum Research的市场预测及2026年上半年对824名AI决策者的调查数据。

报告关键发现包括:

  • 预留和自有基础设施已占AI计算消耗的66%,而按需云服务仅占19%。
  • 59%的受访AI决策者主要在超大规模公有云之外运行工作负载,涵盖自建数据中心、托管设施以及裸金属或高性能计算提供商。
  • 全球AI推理支出预计将从2025年的1200亿美元增长至2030年的8850亿美元。
  • 受多步骤AI系统生成海量Token驱动,代理和推理工作量预计在2026年增长219%。
  • AI优先云成为增长最快的基础设施层级,预计2026年支出增长107.1%,到2030年达到3752亿美元。

从实验到生产的架构演进

报告描绘了典型的基础设施演进路径:从用于初始实验的无服务器API,过渡到按需GPU,最终转向预留基础设施,形成混合AI架构。在此模型下,组织根据利用率、成本、延迟、数据治理及控制需求,为每项工作负载匹配最优环境。

QumulusAI首席执行官Michael Maniscalco表示:“在实验阶段,按Token计费合理;但当AI应用进入持续生产阶段,经济模型迅速变化。企业需制定更谨慎的基础设施战略:利用灵活服务进行实验,同时为可预测的高容量工作负载预留能力。目标并非取代公有云,而是将每项工作负载置于最具经济效益和运营合理性的环境中。”

Futurum Research建议,对于具有持续且可预测利用率、高Token吞吐量、专用模型服务需求或数据隐私及驻留限制的工作负载,应采用预留裸金属基础设施;而对于突发性或实验性工作负载,无服务器或按需服务更为合适。

Futurum Research半导体、供应链与新兴技术研究总监Brendan Burke指出:“企业并非选择单一基础设施模型,而是在构建混合环境,在保留按需灵活性的同时,将可预测的生产工作负载迁移至预留容量。随着智能体AI推高Token用量,迁移时机将成为成本控制的关键。”

QumulusAI提供专用的预留裸金属及虚拟化GPU基础设施,用于AI推理和训练。其方案赋予客户对计算环境的直接控制权,并以基于预留硬件容量和利用率的费用结构,取代可变的按Token收费模式。