检索技术正在经历快速迭代。Cursor 近期放弃嵌入向量搜索代码,转而依赖 grep 和索引搜索;其他团队也正用 Jev 等新模型替换传统重排序器。然而,面对文档、工单、代码等复杂的公司知识库,大多数团队缺乏在真实数据上衡量检索系统性能的有效方法。

为此,企业知识检索平台 Kapa 构建了“公司知识库基准测试”(Company Knowledge Bench)。该基准基于 1,000 个真实生产数据标注案例,旨在评估不同检索策略在完整性、最小性和来源偏好上的表现。测试结果显示,经过优化的代理检索器在准确性、延迟和成本之间取得了最佳平衡。

为何公共基准测试失效

现有的公共检索基准测试多局限于法律或医学等单一领域,或基于合成数据构建,无法覆盖企业场景的多样性。Kapa 的用户用例涵盖开发人员查询 API 规范、销售人员检索客户信息、支持团队起草回复等;查询形式也从人类用户的自然语言到代理生成的精确搜索词不等。这种复杂性要求建立基于真实生产数据的专属基准。

评估标准与方法论

Kapa 定义优质检索需满足三个核心属性:

  • 完整性:返回的信息块足以让代理完整回答查询。
  • 最小性:移除任何一块都会导致信息缺失,避免冗余 token 增加推理难度和成本。
  • 来源偏好:优先选择权威性高(如官方文档优于论坛帖子)和时效性强(如最新 Slack 线程优于过时 Wiki)的来源。

为确保规模与准确性,Kapa 采用“基准测试创建的基准测试”方法。首先由人类手工标注 170 个案例作为黄金标准,训练并验证代理标注器,直至其与人类标注达成高共识率。随后,利用这些代理从生产数据中生成剩余的评估案例,最终形成 1,000 个高质量测试集。

七种检索器性能对决

测试对比了七种检索策略,包括传统固定管道、代理检索器及 Kapa 自有模式。所有检索器在同一语料库和分块策略下运行。

固定管道:重排序是高性价比之选

传统 RAG 管道中,混合搜索加重新排序是最大的低成本收益点。相比纯混合搜索(得分 0.41),引入重排序器将得分提升至 0.50,仅增加不到一秒延迟,且成本远低于大模型调用。而查询分解虽将得分进一步提升至 0.56,但导致延迟翻倍至 1.8 秒,并增加了模型调用成本。

值得注意的是,经过高度优化的固定管道(Kapa Default)在 3.3 秒内获得了 0.61 的得分,与最强的 grep 代理持平,但速度快五倍,且拥有固定管道中最高的精确率。

代理检索:智能至关重要,但成本高昂

代理检索器通过模型决定搜索路径。测试发现,模型能力对结果影响显著。使用强大模型(gpt-6.1-sol)的 grep 代理得分达 0.61,而较小模型(gpt-6.1-luna)仅为 0.54。这表明,若无足够智能的模型支撑,简单的代理循环并不优于精心设计的固定管道。

然而,代理检索面临严峻的成本与延迟挑战。grep 代理每次查询耗时 13-17 秒,模型调用成本约 0.17 美元。更隐蔽的成本在于返回内容:grep 代理平均返回 40,000 个 token,是固定管道的四倍,导致下游代理的推理成本激增。

Kapa Deep:实现最佳平衡

Kapa 的深度模式(Deep mode)作为一种优化的代理检索器,展现了“两全其美”的效果。它在约 5 秒内实现了最高的 0.65 得分,精确率达 0.26(远超其他检索器的 0.12 或更低)。更重要的是,它每次查询仅返回约 5,000 个 token,大幅降低了下游推理成本,每 1,000 次查询的读取成本仅约 10 美元。

结语

随着企业级代理的普及,检索系统的竞争维度已从单一的准确性扩展至延迟和成本。Kapa 的基准测试表明,虽然简单的 grep 配合大模型能提供高精度,但其高昂的资源消耗使其难以规模化应用。未来,结合智能规划与严格预算控制的优化代理检索,将是提升企业知识库效率的关键方向。