ABBYY正为其Vantage平台引入零样本文档提取功能,并开发一种模块化、多模型架构,旨在推动企业AI项目从试点阶段迈向规模化部署。

零样本能力上线

“就在本周,我们通过Phoenix Plus在Vantage平台内部发布了零样本功能及其他特性。该产品今日正式交付市场。”ABBYY AI战略副总裁Max Vermeir表示。

该功能无需客户为每种格式创建模板或汇编标记训练数据,即可从未见过的文档类型中提取信息。作为ABBYY优化的文档处理模型组合,Phoenix Core结合了计算机视觉、图像增强及文档结构识别技术;Phoenix Plus则增加了生成式能力,专注于解释结构内的信息,支持零样本和少样本提取、分类、问答及数据丰富化。

ABBYY正将该组合与编排及模型路由功能集成,以便为特定任务选择最佳技术。客户既可使用ABBYY内置模型,也可通过“自带模型”选项连接已在自身基础设施中获批部署的模型。此外,公司致力于将各功能作为独立组件提供,允许客户在不同产品和环境中灵活部署,而非必须采用整套平台配置。

相关工作包括向成熟的文档捕获产品FlexiCapture添加组件,并调整FineReader Engine的交付方式。路线图还涵盖辅助人工审查代理、工作流增强及对Vantage的进一步功能丰富。

Vermeir指出:“现在的问题不再是‘AI是否已进入企业’,而是‘它真的有效吗?’关键在于能否产生有助于组织运营的实用成果,而非仅停留在令人印象深刻的演示层面。”

模型路由与治理

“没有单一模型能通吃所有场景。你需要的是一个由不同技术组成的组合。”Vermeir强调,尽管生成式AI对处理混乱、歧义且需推理的文档至关重要,但治理层才是区分成功试点与真正生产级应用的核心。可靠性、可审计性和成本控制决定了投资回报。

ABBYY的方法融合了确定性技术、机器学习和概率生成模型。其编排层旨在将每个任务路由至适当模型,同时应用通用验证规则、政策和监督机制。这种架构解决了高容量流程运营公司的实际痛点:避免对每个任务使用大型通用模型导致的可变结果和不可预测的Token成本。专用模型处理 narrowly defined 功能,生成系统则保留给需要解释或推理的工作。

该平台包含针对异常的人工在环审查,并在整个工作流中保持可追溯性。ABBYY将这些控制措施定位为受监管或运营敏感领域的必需品,确保组织能明确信息来源及自动化决策逻辑。

Vermeir表示,运营系统需从相同输入中获得一致结果,实现与现有软件的无缝集成及成本可控。底层模型的能力虽已足够,但其有用性取决于能否访问准确代表组织运作方式的数据。目前,ABBYY拥有超过150种涵盖不同文档类型的专用模型,支持小任务特定模型、机器学习、语言模型和符号推理的组合。

文档上下文与智能体

“企业依靠文档运行并非怀旧,而是现实。”Vermeir称,合同、发票、索赔等文件仍是记录义务、证据和财务信息的主要手段。许多公司此前仅自动化了文档处理的前后环节,中间仍保留人工审查。ABBYY认为,系统不仅需提取文本,更需识别布局、关系、上下文及含义。

公司将此描述为源文档与企业AI系统之间的“感知层”,将非结构化信息转换为标准化操作数据,供软件及自主智能体决策使用。随着智能体AI被引入以规划任务和协调工作流,这一需求愈发重要。错误或未完成的文档数据可能导致智能体以更大速度和规模将错误传入后续系统。

在一个保险部署案例中,文档智能和AI辅助工作流用于提取索赔信息并与记录系统验证,异常情况转交人工审查,其余流程自动化。据称,该部署将处理周期缩短了80%以上。截至目前,ABBYY技术已处理超2000亿份文档,每年处理数十亿页,服务于30多个行业,支持200多种语言,拥有超10,000个部署案例。

推进开源标准DocLang

“DocLang是一种原生AI文档标准,允许将所有商业信息封装在专为AI构建的格式中。它提供机器可读信息、开放标准和可靠管道,内置治理机制,并能将Token消耗减少40%至80%。”Vermeir介绍道。

ABBYY正与IBM、英伟达、红帽和Linux基金会共同参与DocLang倡议,旨在建立一种共同的表示形式,用于将文档信息传输至AI和智能体工作流。提议的上下文层位于现有企业内容与模型或智能体之间,以机器可读格式保留文档结构和商业信息,减少各组织单独构建解析器和转换管道的需求。

ABBYY计划在产品路线图中支持DocLang导出,并将相同的文档理解组件扩展至Vantage、FlexiCapture和FineReader Engine。该标准目前正在Linux基金会下作为开源项目开发。