告警分诊与调查
把一批告警聚类排优先级,对单条告警做根因调查,导出事件报告并推送结论。需要专业版许可。
告警分诊和告警调查需要专业版或企业版许可。未激活时页面可以浏览,运行时提示升级。
批量分诊
告警分诊 对 Alertmanager 中当前触发的告警做分诊:按告警名聚类,结合设备的厂商、角色和机房排优先级,由模型逐簇评严重度、判断是否为噪声,并给出处置建议。

步骤
- 在 分诊范围 中设置:是否包含已静默的告警、最多分诊条数、送模型评分的聚类上限。也可以从实时告警中用 送去分诊 只分诊选中的告警。
- 点 开始分诊。
- 结果按优先级排成 分诊队列。顶部汇总告警总数、聚类数、建议升级的组数、严重聚类和疑似误报。
点一行查看受影响设备、处置建议、运行手册、告警摘要和这台设备的抖动与降噪情况。每个聚类可以:
| 操作 | 说明 |
|---|---|
| 建议升级 | 标记为升级并推送到订阅了升级推送的通知目标,见通知 |
| 深入调查 | 对这组告警的第一台设备做根因调查 |
| 静默 | 对这组告警涉及的设备建一条静默 |
| 对比 | 加入底部并排对比 |
可以多选聚类,一次修改处置状态。保存此次分诊 后全队可见,可以加备注;导出 CSV 导出队列。历史分诊 列出保存过的分诊。
模型评分失败时,聚类按严重度和受影响设备数排序,不带 AI 建议,可以稍后重试。
告警调查
在实时告警详情或分诊队列中点 深入调查,打开 告警调查。模型自主调查:多轮查询这台设备和相关链路的实时指标,引用知识库中的运维手册,然后给出结论。通常需要 30 到 60 秒。

结论包括:
- 误报判定、时间线、可能原因和相关信号;
- 实时指标证据:已执行的 PromQL 和返回的序列;
- 引用的运维手册、受影响对象和处置建议;
- 查询过程:每一步调用了什么、成功还是失败。
调查之后可以:
| 操作 | 说明 |
|---|---|
| 导出事件报告 (Markdown) | 生成一份故障报告 |
| 推送结论 | 推送到订阅了 AI 调查结论的通知目标 |
| 转成告警规则 | 把确认的故障转成 Prometheus 告警规则,见告警规则 |
没有配置大模型时,调查不做根因推断,只整理实时指标和运维手册作为证据。
调查和分诊都保存在分析记录中。