Instacart 推出 Blueberry AI 助手处理线上故障

Instacart 推出名为 Blueberry 的 AI 辅助事故响应系统,为值班工程师自动汇总告警、日志、部署信息和历史事故数据,并在 Slack 线程中生成根因假设。

Instacart 正在使用名为 Blueberry 的 AI 辅助事故响应系统,帮助值班工程师处理生产环境故障。该系统由 Instacart 工程团队于 2026 年 7 月 14 日公开介绍,定位是为线上故障排查提供上下文和初步分析,而不是替代工程师做出最终处置决定。

Instacart 推出 Blueberry AI 助手处理线上故障主题相关图片
来自网络

按照 Instacart 和 InfoQ 的介绍,Blueberry 可以接收生产告警,并从服务归属信息、部署记录、日志、指标、内部文档以及历史事故案例中收集相关背景。系统会利用多个 AI 智能体并行分析这些信息,再将具有事实依据的根因假设直接发布到工程师正在使用的 Slack 对话线程中,通常在约三分钟内给出初步排查结果。

Blueberry 的设计重点并不只是调用通用大模型,而是把模型推理与 Instacart 自身的运维知识和工具连接起来。系统会根据不同团队的服务、操作手册和调试工具调整排查过程,并持续保存调查进度。其工作流程包括告警和消息筛选、持久化任务管理,以及面向具体团队的工具和知识加载。

InfoQ 援引 Instacart 信息称,Blueberry 在 2026 年 4 月于 270 多个 Slack 频道完成了约 2.5 万次诊断。接入超过 14 年的历史事故数据后,系统诊断准确率从约 60% 提升到 90% 以上;相关工作流成功率达到 99.9%,MCP 工具调用次数超过 5.8 万次,并可适配约 60 个团队的工作模式。

在权限边界上,Blueberry 主要负责收集信息、生成假设和辅助调试,不会擅自修改生产环境。故障诊断、应急决策和修复操作仍由工程师完成。对 Instacart 而言,这种模式的价值在于缩短故障发生后收集背景信息的时间,让值班人员能够从已经整理好的日志、部署和系统上下文开始判断,而不是从零开始定位问题。

Blueberry 也体现了企业级 AI 运维系统的一种落地路径:模型能力只是基础,真正影响效果的还包括组织内部知识、工具调用、持久化状态和反馈机制。Instacart 的实践显示,AI 在事故响应中的角色更接近一个能够快速完成信息整理和模式匹配的协作助手,工程师仍然需要对根因判断和生产变更承担责任。