跳到主要内容

告警分诊与调查

把一批告警聚类排优先级,对单条告警做根因调查,导出事件报告并推送结论。需要专业版许可。

告警分诊和告警调查需要专业版或企业版许可。未激活时页面可以浏览,运行时提示升级。

批量分诊

告警分诊 对 Alertmanager 中当前触发的告警做分诊:按告警名聚类,结合设备的厂商、角色和机房排优先级,由模型逐簇评严重度、判断是否为噪声,并给出处置建议。

告警分诊

步骤

  1. 在 分诊范围 中设置:是否包含已静默的告警、最多分诊条数、送模型评分的聚类上限。也可以从实时告警中用 送去分诊 只分诊选中的告警。
  2. 点 开始分诊。
  3. 结果按优先级排成 分诊队列。顶部汇总告警总数、聚类数、建议升级的组数、严重聚类和疑似误报。

点一行查看受影响设备、处置建议、运行手册、告警摘要和这台设备的抖动与降噪情况。每个聚类可以:

操作说明
建议升级标记为升级并推送到订阅了升级推送的通知目标,见通知
深入调查对这组告警的第一台设备做根因调查
静默对这组告警涉及的设备建一条静默
对比加入底部并排对比

可以多选聚类,一次修改处置状态。保存此次分诊 后全队可见,可以加备注;导出 CSV 导出队列。历史分诊 列出保存过的分诊。

模型评分失败时,聚类按严重度和受影响设备数排序,不带 AI 建议,可以稍后重试。

告警调查

在实时告警详情或分诊队列中点 深入调查,打开 告警调查。模型自主调查:多轮查询这台设备和相关链路的实时指标,引用知识库中的运维手册,然后给出结论。通常需要 30 到 60 秒。

告警调查

结论包括:

  • 误报判定、时间线、可能原因和相关信号;
  • 实时指标证据:已执行的 PromQL 和返回的序列;
  • 引用的运维手册、受影响对象和处置建议;
  • 查询过程:每一步调用了什么、成功还是失败。

调查之后可以:

操作说明
导出事件报告 (Markdown)生成一份故障报告
推送结论推送到订阅了 AI 调查结论的通知目标
转成告警规则把确认的故障转成 Prometheus 告警规则,见告警规则

没有配置大模型时,调查不做根因推断,只整理实时指标和运维手册作为证据。

调查和分诊都保存在分析记录中。

本页内容