AI 正在重塑故障处理流程,但棘手问题仍需人类解决
核心观点
AI 正在飞速改变工程团队处理生产故障的模式:汇总故障沟通记录、解析不熟悉的代码、给出修复方案、生成代码合并请求,还能越来越多地辅助故障排查诊断。然而,Uptime Labs 在其故障处理行业峰会(Incident Fest)专题研讨中指出一个悖论:AI 自动化的常规工作越多,当系统以新颖、复杂或意想不到的方式发生故障时,人类专业知识的重要性就越高。
此次讨论汇集了 Uptime Labs、Chime 和 Rootly 的观点,旨在探讨当 AI 成为事故指挥中的一名"参与者"时会发生什么。核心论点并非要拒绝使用 AI,而是企业需要有意识地规划如何引入 AI。
"剩余原则"(Leftover Principle)
讨论中最引人注目的概念是"剩余原则"。随着自动化接管各类常规任务,留给人类处理的工作都是那些非常规、模糊难解、自动化系统尚且无力解决的难题。
事故响应尤其容易受到这种效应的影响:
- 如果 AI 越来越擅长处理简单故障,工程师需要处理的常规事故就会减少,对应的实操历练也随之减少
- 一旦极端复杂的故障突如其来,负责处理它的工程师可能比前几代人缺乏实际操作经验
四重关联风险
Uptime Labs 描述了几种相互关联的风险:
- 剩余事故更难处理 — 常规事故被 AI 解决,留给人类的都是硬骨头
- 人类技能退化 — 缺乏历练导致处理能力下降
- 态势感知丧失 — 响应者往往在 AI 完成大量初步诊断后才介入,可能失去对现场态势的感知
- "责任缺口" — 人类虽然仍需为决策负责,但却不再具备做出自信决策所需的专业知识
AI 误导的代价
Uptime Labs 援引 J. Paul Reed 分享的一项研究结论:
- 当 AI 给出的诊断建议准确无误时,工作人员的处置效率会远超无 AI 协助的状态
- 但倘若 AI 给出错误建议、形成误导,人类的表现反而会远不如完全不靠 AI 协助的时候
启示:不是简单地"使用 AI",而是要分清哪些场景可以信任 AI 的输出、怎样验证 AI 给出的结论,以及何时必须收回主导权交由人类处理。
AI 加速变更的次生风险
AI 辅助开发可能急剧增加软件的构建和变更数量。Uptime Labs 用通俗逻辑解释了故障发生频次的影响因素:
事故数量 = 受"变更量"和"任一单一变更引发故障的概率"两个变量影响
AI 可能大幅增加第一个变量(变更量),而 AI 生成的代码、测试、依赖项和配置的质量将决定第二个变量(故障概率)。
应对策略
- 成熟工程实践不可弱化:严格的部署管控、可观测性、功能开关、自动化测试、韧性工程以及快速回滚机制
- 加大投入维持人员技能:借助故障演练、场景模拟、桌面推演、混沌工程以及常态化故障处置实操训练
- NIST 2026 年研究也强调"人机反馈循环"研究不足,企业需了解人类如何对接、校验 AI 给出的判断
结论
AI 可能会从根本上改变事故响应者的角色,但并不会消除对事故响应者的需求。随着 AI 处理越来越多的常规工作,工程师可能会越来越多地负责处理那些罕见的、模糊的、后果严重的事故——这些正是超出自动化诊断能力范围的问题。
英文原文:https://www.infoq.com/news/2026/08/ai-incident-response/