平台自检
检查 Prometheus 与 Alertmanager 自身的健康,按检查项给出结论和建议,由模型串起来解读。需要专业版许可。
平台自检 在侧栏底部 管理 组中,以页顶标签打开。需要专业版或企业版许可,未激活时页面可以浏览,运行时提示升级。

自检只读:网关调用 Prometheus 和 Alertmanager 的只读接口,每一项给出结论和可以手工执行的建议,从不改动客户的监控栈。
检查项
| 检查项 | 看什么 |
|---|---|
| Prometheus | 是否在线、版本 |
| TSDB 序列 | 头部序列数和 chunk 数,序列过多会推高内存 |
| 高基数 | 序列数超过阈值的指标和标签,按数量排行 |
| 规则评估 | 规则组和规则数,评估出错的规则,耗时超过评估间隔一半的规则组 |
| 抓取目标 | 失败的目标比例、接近超时的目标 |
| Alertmanager | 集群状态、成员数、版本 |
| 告警投递 | Prometheus 连接的 Alertmanager 数量,是否有通知被丢弃 |
每项结论为正常、注意、需处理,权限不足或接口不可用时为查不了。点 重新体检 重跑。
AI 解读
点 AI 解读,模型把各项结果串起来看,指出先处理哪几项及原因,并引用知识库中的运维手册。模型没有返回可用结果时,按检查项本身的严重程度排序。