AIAgentObservability

从看见问题到解决问题,Agent 重新定义可观测

凌敏··原文链接
收录于 2026/7/15 22:51:32

文章源自 InfoQ《C 位面对面》栏目,InfoQ 总编辑王一鹏对话观测云创始人 & CEO 蒋烁淼,核心观点如下。

1. Agent 爆发后,可观测更重要了

Gartner 预警:到 2028 年,公民开发者采用 Prompt-to-App 方式可能使软件缺陷增加 2500%。Vibe Coding 批量生产的"日抛型软件"一旦接入数据库、承接真实业务,就成为需要日志、指标、链路、告警、权限控制和故障响应的 Online System,但运维工具分散在不同系统中,运维团队难以兜底。

蒋烁湘认为,可观测不能再用"指标、日志、链路追踪"三件套概括,真正的可观测是"全面无死角的体检"——尽可能完整记录系统运行信号。像 Profiling 火焰图这类二进制数据,传统上只有"老法师"看得懂,现在 Agent 可以跨越指标、日志、调用链、拓扑和运行时数据,先拼出整体状态再帮工程师定位问题。

更深层的变化是 Agent 本身也在成为新的观测对象,催生出 ABA(Agent Behavior Analytics,Agent 行为分析)方向。观测云已支持将 OpenClaw、Hermes、Claude Code、Codex 等的数据收集到平台追踪。蒋烁淼指出,最理想的 Agent 观测入口是统一的 AI 网关——模型调用、Token 收发和工具调用都经过这里,企业才能建立可追溯的行为链路。

此外,非技术人员用 Vibe Coding 搭出的"影子 IT"天然处于可观测盲区,这进一步放大了可观测的紧迫性。

2. 可观测平台,正在变成系统的"统一上下文"

蒋烁淼的判断是:可观测性平台更像是系统的统一上下文平台。上下文决定了人类工程师的排障效率,也决定了 Agent 会不会陷入幻觉。当下模型能力差距正在缩小,真正拉开 Agent 差距的关键是拥有独特的上下文。

观测云产品思路的"变与不变":

  • 不变的是底层能力:数据采集(DataKit 支持超 600 种采集)、海量实时写入、低延迟查询,以及自研数据库 GuanceDB 3.0(完全存算分离架构,统一数据管理、标签体系和 DQL 查询语言,实现全链路数据深度关联)。这些"不那么 AI"的能力反而最难替代。
  • 变的是交互与自动化方式:Dashboard 不再需要低代码拖拽,几句自然语言就能让 Agent 基于平台数据和 API 自动生成;Workflow 从"人画流程图"转向"Agent 自循环、自决策"。蒋烁淼直言:"我们要推行的是面向未来的 AI-Driven 自动化,而不是人类画流程图的自动化。AI 的注意力可能会飘散,但它不会偷懒。"

3. 从看得懂到能上岗,观测 Agent 进入工作流

观测云沿三层问题逐层下探:

  • 第一层:OWL 打通上下文。 提供 CLI 和 MCP Server 两种接入形态,将指标、日志、事件、监控器、仪表板、APM 等封装为标准化工具,可装进 Claude Code、Codex 等 Coding Agent,让 AI 直接查询生产环境观测数据并执行根因分析,无需生产环境访问密钥。解决"幻觉对幻觉的大厮杀"——研发和 AI 都看不到真实上下文就只能猜。
  • 第二层:Obsy AI Copilot 降低理解门槛。 底层 Runtime 已从固定工作流升级为 Manager Agent 形态,注册了 Skill、上下文和大量 System Prompt。支持日志相关性分析、监控器配置、自然语言生成 Dashboard 等。本质是帮人类更好使用观测云产品、与各种 Agent 做验证。
  • 第三层:Guance AI Agent Teams 可靠行动。 瞄准生产环境诊断、协同和行动闭环,可放进飞书、钉钉、微信等协作场景。产品设计上做了明确权限区分:IM 里的 Agent 默认只读,操作能力放在 Task 页面并由企业封装成 API。内建排障方法论(告警分诊→影响面判断→假设生成→证据收集→根因定位→动作建议→审批执行→结果验证),治理能力作为产品能力交付:默认只读、最小权限、高风险审批、操作留痕、证据链可追溯、处置后可验证。

"笔记"功能已升级为 AI 自动生成故障笔记,作为 Agent Teams 的长期记忆层,让 Agent 持续学习提升准确度。三层叠加构成"看得懂 → 调得动 → 控得住"的完整闭环。

4. 结束语:Agent 负责执行,Builder 负责定义结果

蒋烁淼对 AIOps 的判断很直接:没有完整运行态上下文,"不管是 AI 还是人类,这真的不叫 AIOps,这叫做神仙 Ops"。Agent 没有削弱可观测的价值,反而把它从后台推到系统中央——AI 要判断就需要事实,要行动就需要边界,要减少幻觉就需要完整、实时、可验证的上下文。

人不会退出循环,但关键能力变了:从亲手写代码、手动查问题,转向提出正确问题、定义清楚目标、提供足够上下文、验证 AI 结果。蒋烁淼把这类人称为 Builder——更懂技术架构、能活用工具、能把大问题拆成小问题并对最终结果负责的人。

我的看法

这篇文章本质是观测云的产品发布会软文,借 InfoQ 对话包装了三层产品线(OWL / Obsy AI Copilot / Guance AI Agent Teams)。核心论点"可观测平台是统一上下文"站得住脚——上下文确实是 Agent 时代的稀缺资源,谁掌握了全链路数据关联谁就有壁垒。但需注意几点:

  1. "AI 网关统一入口"的提法偏理想化,现实中多模型、多渠道、桌面端 Agent 的行为轨迹很难完全收口到一个网关。
  2. GuanceDB 存算分离是行业趋势而非独有优势,Datadog、Grafana 等也在做类似演进,差异化更多在数据采集广度和关联深度上。
  3. "Agent 自循环 Workflow"在生产环境的风险控制仍是未解难题,文章提到的审批/留痕/验证更多是框架性承诺,实际落地效果有待观察。
  4. 对前端技术专家而言,值得关注的信号是:可观测平台正在从"给人看"转向"给 Agent 用",MCP Server 接入形态会改变 DevTools 的交互范式,DataKit 这类采集器的标准化能力比 UI 更重要。

文章信息密度尚可,但需剥离营销层看技术判断。

评分:
暂无0 人评分)