人工智能正在改变工程团队处理生产故障的方式。如今,AI 工具可以汇总故障处置过程中的沟通记录、解析不熟悉的代码、给出修复建议、自动生成合并请求,并在越来越多的场景中辅助定位根因。但 Uptime Labs 在其 Incident Fest 专题讨论中提出了一个值得注意的悖论:AI 自动化掉的常规工作越多,当系统以新颖、复杂或出人意料的方式失效时,人类的专业判断反而越关键。

这场讨论汇集了 Uptime Labs、Chime 和 Rootly 的实践观察。其核心结论并不是排斥 AI,而是提醒企业要有意识地规划引入方式。AI 确实能显著减轻值班工程师的认知负担,但团队需要警惕自动化在无形中侵蚀人员的技能、态势感知与决策能力——这些恰恰是 AI 抵达能力边界后,处理棘手故障所必需的。
AI 的收益有据可查。Uptime Labs 援引 J. Paul Reed 分享的研究指出,当 AI 的诊断建议正确时,使用者的表现可以比完全不借助 AI 时提升约 53% 至 67%;但同一研究也显示,一旦 AI 给出误导性建议,人的表现反而可能显著低于不借助 AI 的基线水平。这带来的启示不是简单地“用不用 AI”,而是要弄清楚在什么情况下可以信任模型输出、如何核验其结论,以及何时需要把控制权交回给人类。
讨论中提出的一个关键概念是“剩余原则”(Leftover Principle):随着自动化接管常规任务,留给人类的工作会越来越集中于那些非常规、模糊、自动化尚未解决的难题。故障处置尤其容易受此影响——如果 AI 越来越擅长处理简单故障,工程师遭遇常规事故的机会减少,实操历练也随之减少;等到真正复杂的故障出现时,负责处理的人可能比上一代工程师更缺乏实战经验。
由此带来的风险相互关联:
- 剩余故障的难度上升——没有被自动化的,本身就是更罕见、更新颖的场景;
- 人的技能因缺少练习而退化;
- 响应者往往在 AI 完成大量初步排查后才介入,从而丢失现场情境;
- 组织中出现“责任缺口”——人依然为决策负责,却未必保有做出自信判断所需的专业知识。
这一现象与数十年来关于“自动化悖论”的研究一脉相承,最早可追溯到 Lisanne Bainbridge 1983 年的论文《Ironies of Automation》,其核心悖论在于:自动化程度越高,人的作用反而越关键,而非越弱。对于故障响应而言,这意味着不能想当然地认为 AI 可以取代资深工程师,反而需要更有意识地通过故障演练、桌面推演、混沌工程和常态化处置训练来维持技能。
类似担忧也出现在研究机构的报告中。美国国家标准与技术研究院(NIST)在 2026 年关于监控已部署 AI 系统的研究中提到,人机反馈循环方面的研究仍然不足,在 AI 快速部署的同时难以规模化开展由人主导的监控,自动化监控与人工核验之间如何平衡也尚无定论。这些发现说明,仅仅在 AI 流程里“放一个人”并不足够,组织需要理解人与 AI 建议之间的互动如何长期影响决策质量。
另一个容易被忽视的维度是:AI 辅助开发可能大幅提升软件的构建与变更速度。Uptime Labs 的讨论以 GitHub 的周提交量从约 1900 万次跃升至约 2.75 亿次为例,说明变更规模的变化;Faros AI 的 2026 年工程报告则显示,平均每个合并请求引发的故障事件上升了近 250%。故障的发生频次取决于变更总量与单次变更引发故障的概率:AI 可能显著推高前者,而后者则取决于 AI 生成代码、测试、依赖与配置的质量。
正因如此,成熟的工程实践在加速变更的环境下反而更重要——严格的部署管控、可观测性、功能开关、自动化测试、韧性工程和快速回滚,成为让错误被及时发现、有效遏制并安全恢复的关键手段。目标未必是阻止每一个由 AI 引入的错误,而是确保错误能被快速检测、有效隔离并安全回退。
在中国的落地实践中,类似的判断也在被反复印证。《中国教育网络》报道的内蒙古科技大学案例显示,其信息化部门已将 AI 用于告警降噪、故障分析和解决方案生成,运维效率确有提升;但受制于 Token 成本较高、出于风控考虑自动化执行方案仍需人工审核,以及 AI 仍存在幻觉问题,高级网管和系统管理员在当前阶段仍难以被替代。
学术研究也给出了相近的信号。一项在混沌工程框架下评估大语言模型自动根因分析能力的研究,测试了多个先进模型:零样本条件下准确率约为 44% 至 58%,少样本提示下提升至 60% 至 74%,而参与对比的站点可靠性工程师准确率超过 80%。研究者认为,大语言模型可以充当故障响应的“副驾驶”,但人类监督仍然必不可少。
另一项面向生产环境的研究,将智能体式 AI 引入基于运行手册的故障处置流程,在 17 周内覆盖 232 起生产事故。其做法不是让 AI 取代操作者,而是由 AI 依据运行手册和系统工具引导人工操作者完成处置,再评估结果并针对手册中的缺口提出修订建议,以运行手册作为人与自动化之间的桥梁,保持过程的可解释性。
综合这些讨论与实践,一个逐渐清晰的共识是:AI 正在改变故障处理者的角色,却没有消除对人的需求。随着 AI 接管更多常规工作,工程师的重心将更多转向那些罕见、模糊、后果严重的故障——这正是自动化尚未覆盖、也最需要人类判断力的领域。对团队而言,引入 AI 的关键不在于追求最大限度的自动化,而在于有意识地维护人的技能与情境感知,并为“何时信任模型、何时收回控制权”建立清晰的判断框架。