AI渗透测试领域领导者Novee宣布,其针对实时Web应用程序的代理渗透测试基准PWNBench,正式与Fireworks专业智能指数(Specialized Intelligence Index, SII)同步上线。

PWNBench由安全从业者构建,旨在衡量AI模型在具有模糊性和多步骤特征的进攻性安全工作中的表现。该基准突破了公共测试中常见的受限、静态任务局限,为安全团队和模型开发者提供了现实标准,用于比较模型在代理渗透测试关键能力与权衡取舍方面的表现。

模型表现差异显著

最新评估结果显示,当前主流模型在实时攻击性安全工作中的表现存在显著差异。在效率前沿分析中,Grok 4.5、Grok 4.6和DeepSeek-V4-Flash-0731在F0.5指标与成本之间取得了最佳平衡。

在具体指标上,Claude Opus 5以约1,400美元的API支出换取了最高的召回率(51%);Kimi K3在k=3时的召回率为42%,成本仅为209美元。在精确度方面,Grok 4.6和Claude Opus 4.8均处于70%末段至80%初段的水平。

纳入专业智能指数体系

PWNBench是Fireworks专业智能指数的基础基准之一。该平台致力于对比开源、闭源及专用模型在特定领域任务上的表现,入选基准需满足生产相关性、任务多样性、校准机制及污染披露等要求。目前,PWNBench已与Harvey的法律代理基准以及Doximity的BedsideBench医疗基准等行业标杆并列。

Novee首席AI官Dan Padnos表示,现有基准仅能反映模型是否识别出训练数据中的漏洞,无法证明其能否入侵未见过的运行系统或验证漏洞可利用性。PWNBench通过针对实时应用程序并由从业者评估,真实衡量模型在攻击性安全场景下的能力。

Fireworks联合创始人Benny Chen指出,PWNBench揭示了为何需要专业智能指数。没有任何单一模型能在所有维度领先,该基准通过展示召回率、精确度和成本之间的权衡,帮助团队选择最适合其安全工作流需求的模型。