F5 最新测试数据显示,通过引入英伟达 BlueField-3 数据处理单元(DPU),其 AI 推理性能在不增加 GPU 数量的情况下,最高可提升 3.24 倍。

该结果源于 F5 加州实验室的基准测试。测试集群基于配备八块英伟达 H100 加速器的超微服务器构建,运行 Qwen3-32B 语言模型(FP8 精度)。F5 将其基于 DPU 的 BIG-IP Next for Kubernetes 平台与运行在主机 CPU 上的 Envoy AI Gateway 进行了对比。

智能路由与缓存优化

核心优势在于 F5 的 Endpoint Picker 技术。与传统轮询机制不同,该技术在分发请求前会实时检查 GPU 利用率、可用资源及缓存状态,将 AI 请求定向至最合适的处理器。系统还能利用键值缓存中的已处理数据,避免 GPU 重复执行高昂计算,并根据令牌限制和工作负载要求,在大语言模型与小语言模型间智能路由。

测试涵盖多轮对话、混合工作负载及高并发场景(200 个并发请求,输入长达 20,000 个令牌)。在轻负载下,两种配置性能相近;但当需求超出集群键值缓存容量时,F5 的 DPU 架构展现出显著优势,性能达到主机配置的 3.24 倍。

架构卸载与商业前景

F5 已将 BIG-IP 软件适配至 BlueField-3 DPU 内部的 Arm 处理器上运行。这种架构将流量管理、网络安全及 DDoS 防护等任务从主机 CPU 卸载至 DPU,从而释放宝贵的主机算力用于核心业务。

目前,F5 已将该技术集成至英伟达推理基础设施,并纳入英伟达通用网络参考架构,主要面向云服务商及大型企业用户。尽管 F5 未披露软件及额外 DPU 硬件的具体定价,但测试表明,通过更智能的流量路由,运营商可在不盲目扩充加速器的前提下,显著提升现有 GPU 集群的效率。独立测试将进一步验证该方案在不同模型和 GPU 架构上的普适性。