数十年来,可观测性行业始终围绕“系统是否在运行”这一基本问题展开。然而,代理式人工智能(Agentic AI)打破了这一范式:一个智能体可能返回清晰响应、满足延迟目标且无报错,却仍可能给出错误答案、调用错误工具或引用过时数据。传统指标显示系统健康,但业务结果却宣告失败。

针对这一空白,亚马逊云科技(AWS)上周正式全面推出 Amazon CloudWatch Omni,将其定位为 CloudWatch 的下一代产品。该平台以应用程序为中心,基于 OpenTelemetry 构建并深度集成人工智能,将可观测性的重心从“它是否在运行”转移至“为什么我的智能体会那样做”。AWS 引用 IDC 预测指出,到 2029 年部署的智能体数量将超 10 亿个,人工审查如此庞大的非确定性行为已不现实。

评估即新的监控

Omni 的核心并非仪表盘,而是其评估引擎。该引擎捕获每一笔追踪记录,内置 17 种评估器,对连贯性、有用性、忠实度和路由正确性等指标进行评分。团队可在沙盒中对比不同提示词版本,利用生产流量构建测试数据集并自动捕捉回归问题。评估器还能针对实时流量持续运行,像标记 CPU 飙升一样标记质量漂移。毕竟,延迟和错误率无法反映答案的正确性,而评分可以。

索尼是早期采用者之一。索尼 AI 加速部门高级总经理 Masahiro Oba 表示,索尼企业级代理式 AI 平台已支持数百个概念验证和生产工作负载。“在此规模下,可观测性和评估至关重要。借助 Omni,我可以从单个追踪记录直接跳转至评估、AI 分析、比较或数据集创建。”对于多数企业而言,瓶颈不在于构建单个智能体,而在于治理由不同团队构建、标准各异的数十甚至数百个智能体。从实时追踪中一键创建数据集,有效消除了组装评估数据集的业务瓶颈。

走出控制台,深入开发流程

Omni 提供适用于 Visual Studio Code、Cursor 和 Kiro 的原生扩展,开发者无需 AWS 账户即可在本地运行智能体时查看追踪记录。操作员则通过独立的 Web 体验,利用 Okta 或 Microsoft Entra ID 等现有身份提供商实现单点登录。两者共享单一数据层,确保开发者调试与操作员调查的是同一条记录。

AWS 承认,其传统控制台主要面向基础设施管理员,而非承担运营责任的站点可靠性工程师、AI 工程师和应用所有者。通过在集成开发环境(IDE)中与开发者相遇——尤其是在 Claude Code 和 Codex 等 AI 编码助手设置仪器化时——Omni 将质量保障工作前移至成本最低的修复环节。

统一数据层构建差异化优势

尽管许多初创公司能追踪大语言模型调用,但 Omni 的独特之处在于将智能体追踪、应用遥测数据和基础设施信号存储于同一 CloudWatch 数据存储中。调查可从智能体接收错误工具结果开始,追溯至容量受限服务的 API 错误,最终定位到耗尽的数据库连接池。这在以往通常需要三个工具和团队协作才能完成。此外,AWS DevOps Agent 在调查会话中默认启用,负责关联信号并维护完整的调查历史。

作为设计合作伙伴,Capital One 云平台和弹性工程执行副总裁 Parvez Naqvi 表示,Omni 为其工程师提供了覆盖所有遥测数据的单一界面,具备拓扑感知智能和自然语言查询功能,并通过 OpenTelemetry 实现完全的数据所有权。对于银行等高度监管行业,数据可移植性和调查历史的审计证据至关重要。

开放标准与锁定风险并存

Omni 的仪器化基于 OpenInference 和 AWS Distro for OpenTelemetry,无论智能体运行在 AWS 还是其他云上。平台支持 LangChain、LangGraph、CrewAI、OpenAI Agents SDK 等多种框架及 DeepEval 等第三方评估器,Amazon Bedrock AgentCore 智能体可自动接入。目前支持 Azure 数据摄入,未来将提供更深入的多云覆盖。

在 Datadog、Dynatrace、New Relic 等竞品纷纷扩展至智能体可观测性领域的背景下,这种开放性显得必要。OpenTelemetry 确保了数据的可移植性,但拓扑结构、评估器、调查历史和 DevOps Agent 等智能层功能均在 AWS 上运行。因此,重度投资 AWS 的企业会将 Omni 视为默认选择,而拥有成熟多云部署的公司可能仅将其用于智能体开发和评估,保留原有核心可观测性系统。

定价策略与成本警示

Omni 的 IDE 扩展、仪表盘和警报均免费,查询量包含每月摄入量的五倍。符合条件的账户可获得 30 天试用及 1,000 美元的 OpenTelemetry 摄入信用额度。客户主要为其发送和存储的遥测数据付费,DevOps Agent 单独定价。

需要注意的是,智能体非常“话多”。每个提示词、模型调用、工具调用和子智能体交接都会生成一个跨度。乘以数百个工作负载和持续评估,摄入成本可能超出 AI 预算。企业需在智能体上线前制定采样、保留和评估频率策略,而非等到账单到来。

给买家的建议

Omni 旨在解决让智能体停留在试点阶段的信任缺口。IT 领导者应考虑以下几点:

  • 先定义“好”的标准。若业务负责人未文档化每个智能体的正确、合规且有用的回答,内置评分将毫无用处。
  • 标准化仪器化。无论后端如何,将所有智能体试点置于 OpenTelemetry 之下,以保持选项开放。
  • 模拟遥测成本。在生产规模上预估成本,提前制定策略。
  • 决定核心系统所在地。若 AWS 是主要云平台,Omni 是强有力的默认选择;若是多云环境,可考虑将其用于开发和评估,并与现有设置集成。
  • 重视调查历史。特别是在受监管行业,应将调查轨迹整合到 AI 风险和合规流程中。

行业花费十年学习如何观察分布式系统,而代理式人工智能要求观察决策。AWS 旨在让客户拥有这一层,从中获益最多的公司,将是那些将评估视为运营纪律而非单纯功能的企业。