跳到主要内容

平台自检

检查 Prometheus 与 Alertmanager 自身的健康,按检查项给出结论和建议,由模型串起来解读。需要专业版许可。

平台自检 在侧栏底部 管理 组中,以页顶标签打开。需要专业版或企业版许可,未激活时页面可以浏览,运行时提示升级。

平台自检

自检只读:网关调用 Prometheus 和 Alertmanager 的只读接口,每一项给出结论和可以手工执行的建议,从不改动客户的监控栈。

检查项

检查项看什么
Prometheus是否在线、版本
TSDB 序列头部序列数和 chunk 数,序列过多会推高内存
高基数序列数超过阈值的指标和标签,按数量排行
规则评估规则组和规则数,评估出错的规则,耗时超过评估间隔一半的规则组
抓取目标失败的目标比例、接近超时的目标
Alertmanager集群状态、成员数、版本
告警投递Prometheus 连接的 Alertmanager 数量,是否有通知被丢弃

每项结论为正常、注意、需处理,权限不足或接口不可用时为查不了。点 重新体检 重跑。

AI 解读

点 AI 解读,模型把各项结果串起来看,指出先处理哪几项及原因,并引用知识库中的运维手册。模型没有返回可用结果时,按检查项本身的严重程度排序。

本页内容