按Token计费曾是企业在探索人工智能时的首选方案,但在投入生产环境后,这一模式正成为最糟糕的选择。新兴云服务商QumulusAI赞助、Futurum发布的最新报告《脱离按Token计费的轨道》(The Off Ramp From Per-Token Pricing)深入探讨了这一困境。

报告关键发现指出,智能体(Agentic AI)在完成单个任务时的Token消耗量,可能是简单推理调用的10到100倍。尽管智能体成本更高并非新鲜事,但该报告通过量化分析揭示了其严峻性。多位首席信息官(CIO)和首席财务官(CFO)反映,最成功的AI项目往往因预算严重偏离实际而陷入困境。有企业为某项目年度预算设定为100万美元,却因项目过于成功,仅在三个月内便耗尽了资金。

使用量定价正在惩罚成功

按Token计费的优势在于便捷:开发人员无需容量规划或采购流程,即可快速构建原型。然而,计费机制无法区分试点项目与服务于数万员工的生产系统。聊天机器人仅回答一个问题,而智能体需经历规划、工具调用、检查、重试及总结等复杂步骤,每一步均生成大量Token,使其成为“Token制造机”。

Futurum预测,今年智能体和推理推断的增长率将达219%,总推理支出将从2025年的1200亿美元激增至2030年的8850亿美元。在随消费量线性增长的定价模型下,预算线的增速已远超其创造的价值。

Amberd.ai联合创始人兼首席执行官Mazda Marvasti指出,当工具在组织内部广泛部署时,基于可变基础的定价导致成本飙升,引发管理层对投资回报率的质疑。更危险的是,不可预测的账单可能导致企业放弃有价值的自动化工具。这实质上是伪装成定价问题的治理失败,其阻碍AI普及的程度将超过任何模型局限性。

市场用脚投票:转向自有基础设施

市场数据表明,企业已悄然超越“一切都在公有云中”的假设。Futurum对824名AI决策者的调查显示,预留和自有基础设施占AI算力消耗的66%,而按需云服务仅占19%。约59%的受访者在超大规模公有云之外运行主要AI工作负载,包括自有数据中心、托管设施或裸金属提供商。

这并非意味着企业完全远离超大规模云厂商,部分自有容量源于此前GPU短缺时期的储备。但这反映出企业愿意为AI做出容量承诺,焦点已从“是否承诺”转向“哪些工作负载值得承诺”。这一采用周期与云计算早期历程相似:从按需使用起步,发现稳定负载在预留容量上更经济,最终走向混合模式。AI将这一进程从数年压缩至数个季度,智能体则是主要加速器。

核心经济学:利用率决定成本效益

报告引用了Amberd.ai在QumulusAI裸金属服务器上的部署案例。该公司将配备8块Nvidia H200 GPU的服务器划分为四个虚拟环境,根据延迟容忍度对客户分层。Marvasti表示,两名客户即可覆盖服务器成本,后续加入的30至35名客户均为纯利润来源。

这一案例的核心教训并非裸金属本身便宜,而是通过自定义虚拟化层和分层定价驱动高利用率。预留基础设施将可变成本转化为固定成本,只有保持高负载才能收回效益,闲置的预留GPU才是最高昂的成本。Futurum建议,对于利用率可预测且高于60%的持续工作负载,应采用预留裸金属。但报告也承认,这需要深厚的硬件专业知识,可能限制缺乏相关能力团队的运营利润率提升空间。

未解的战略难题:模型选择权

上述策略适用于可自行部署的开放权重模型,这也是Amberd.ai基于私有开源大语言模型构建的原因。然而,许多企业依赖仅通过API或云市场提供的前沿模型,对于这些工作负载,定价权仍掌握在模型提供商手中。

因此,“预留还是按Token计费”首先是一个模型战略决策。开放权重模型在分类、提取、摘要及智能体子任务中表现日益出色。最具影响力的公司将把工作路由至能以低成本完成的最佳模型,并在最可靠的基础设施上运行。Runpod首席技术官Brennen Smith建议,对于定义明确的业务操作,固定租赁合约最佳;而对于实验性或波动性负载,则需按需使用。他建议同时为两者制定预算,但这要求财务、基础设施和AI团队对工作负载行为达成统一认知,目前多数公司尚不具备这一条件。

给买家的行动建议

按Token计费不会消失,但将其作为生产环境AI的默认选项已是错误。针对IT和财务领导者,建议如下:

  • 衡量每任务成本,而非每Token成本。随着智能体复杂度增加,应追踪解决一个工单或处理一个索赔端到端的实际成本。
  • 设定升级触发器。定义工作负载从API过渡到按需GPU,再到预留容量的利用率和体积阈值,60%的利用率基准可作为起点。
  • 诚实评估运营技能。若内部缺乏管理服务能力,预留基础设施若不能保持忙碌将无法节省资金,需在承诺前考虑引入外部支持。
  • 测试开放权重模型。任何可在开放模型上运行的工作负载,均应尝试摆脱计量计费模式。
  • 谈判硬件周期。合同应涵盖升级路径、续订和可移植性,避免今天的承诺成为明天的沉没资产。

在智能体AI竞争中获胜的公司,未必拥有最佳模型,但一定找到了以大规模、可负担方式运行模型的方法。