企业级智能体的效能往往受限于特定环境中的系统规则与数据状态。即便基础模型能力广泛,在处理具体工作流时仍可能出现效率低下、工具误用或违反约束等问题。将这些薄弱环节转化为高质量训练数据,是提升智能体表现的关键难点。

ServiceNow CoreAI 团队构建了 AutoSynthData 框架,旨在将模型的能力差距直接转化为训练数据。该框架利用目标模型的失败案例与更强“教师模型”的成功案例,动态生成并验证新任务,随着模型进步逐步聚焦于剩余难点。相关流程已通过 EnterpriseOps Gym 及其数据集得到验证。

定义有用的代理任务

有效的训练任务由系统规范、用户提示和验证器三部分构成:

  • 系统规范:定义智能体的运行约束,包括指令、环境策略及初始状态,需确保与环境工具兼容且指令清晰。
  • 用户提示:需具备可行性(环境中存在解决路径)、真实性(符合实际用户需求)及难度(暴露当前模型弱点)。
  • 验证器:需保持一致性、健全性与完备性,既能拒绝违规轨迹,又能接受多种有效解,避免过严或过宽导致的训练偏差。

从失败到课程生成的闭环

AutoSynthData 的核心逻辑在于“诊断-生成-验证”的闭环。系统首先在环境中评估目标模型,识别其失败模式及教师模型的成功路径,提炼出脱敏的“能力规范卡片”。生成器基于这些卡片创建多样化的新任务,而非直接复制原始提示。

数据集构建分为两个阶段:

  1. 目标阶段:并行生成独立任务,经执行、求解器评估及修复后,形成围绕模型弱点的高质量核心样本集。
  2. 倍增阶段:基于已接受的核心样本生成新颖变体,改变实体、状态及工作流组合,同时限制代际漂移,扩展数据规模。

多层级质量控制

为确保数据有效性,AutoSynthData 实施了严格的样本级与批次级审查:

  • 样本级验证:包含正向验证(确认参考轨迹能解决问题)与负向验证(确认错误结果会被判定为失败)。失败候选项经“批评者”诊断后进行针对性修复,而非直接丢弃。
  • 批次级审查:元审查机制监控数据集的覆盖范围与多样性,减少过度代表的任务家族,引导生成资源流向能力缺口。

EnterpriseOps Gym 实验结果

实验在 EnterpriseOps Gym 的 Hybrid 和 ITSM 环境中进行,重点测试监督微调(SFT)效果。

Hybrid 环境:以 Gemma-4-26B-A4B-it 为目标模型,Qwen3.8-27B 为教师模型。AutoSynthData 在约 18 小时内生成 2,000 个合成样本。微调后,最佳检查点使平均 Pass@1 提升 7.2 个百分点(相对提升 35%),验证器成功率从 63.01% 升至 68.55%,弥补了与参考模型间 59% 的原始差距。

ITSM 环境:以 DeepSeek-V4.1-Flash 为教师模型。尽管因模型较大及管道优化前因素导致生成耗时 66 小时,但合成的 1,994 个样本仍将平均 Pass@1 从 18.77% 显著提升至 27.18%。

结果表明,AutoSynthData 能有效定位并填补智能体在复杂企业环境中的能力缺口。随着模型迭代,该机制可动态调整生成策略,持续推动训练前沿,未来亦有望支持强化学习(RL)场景。