跳到主要内容

平台体检

检查 Zabbix 自身:版本、自监控数据、监控队列、进程繁忙度、缓存使用率、HA 节点、proxy 状态、不支持的监控项。AI 解读把未通过的项归因并给出修复顺序。专业版及以上提供。

平台体检检查 Zabbix server 本身:数据是否按时采集、poller 和缓存够不够用、proxy 和 HA 节点是否在线。体检只调用 Zabbix API 读取数据。体检和 AI 解读都属于平台运维助手(platform_ops_copilot),需要专业版或企业版许可,包括试用许可。体检结论和 AI 解读都跟随界面语言。社区版可以打开本页浏览(预览),不执行体检,选择 重新体检 时弹出升级提示。

平台体检页顶部的标签另有调用审计和对外通道。

平台体检

执行体检

步骤

  1. 打开 平台体检,页面自动执行一轮体检。
  2. 修复问题后,选择 重新体检。

体检概览 给出一句结论和三项计数:通过、需处理(异常与注意)、查不了(API 权限不足或缺少内部监控项)。检查项明细 按需处理、通过、查不了分组,每项显示判定、检查结果和修复建议。

查不了 不是错误,常见原因有两个:

  • 队列、进程、缓存三项读取 Zabbix server 的内部监控项(zabbix[...])。确认主机「Zabbix server」已链接模板「Zabbix server health」,且网关使用的 API 账号对该主机有读权限。主机名不同时,设置 RST_ZABBIX_SERVER_HOST。
  • HA 节点一项调用 hanode.get,需要超级管理员权限。权限说明见 Zabbix 权限。

获取 AI 解读

各检查项单独看都有结论和建议,模型的作用是把它们串起来:例如 unreachable poller 繁忙、队列增长、某个 proxy 失联,往往是同一个原因(某个站点的链路断了)。AI 解读说明哪几项属于同一个根因、先修什么、怎么修。

前提条件

  • 专业版或企业版许可,包括试用许可。

步骤

  1. 体检有未通过的项时,在页面右上角选择 AI 解读。

AI 解读

各项都通过时不显示 AI 解读,也不调用模型。配置了知识库时,模型会检索相关文档,结果中注明 参考了知识库。模型没有返回可用结果时,页面按检查项本身的严重程度排序显示。

检查项

检查项检查内容判定
Zabbix 版本apiinfo.version 返回的版本低于 6.0 为注意(官方已停止支持)。6.x 中非 6.0 LTS 的版本为注意
自监控数据Zabbix server 的内部监控项是否在更新超过 RST_OPS_INTERNAL_STALE_S(默认 900 秒)没有更新为异常。找不到内部监控项或有不支持的内部监控项为注意
监控队列zabbix[queue,10m]:延迟超过 10 分钟的监控项数不少于 1 为注意,不少于 100 为异常
进程繁忙度各类进程的平均繁忙度 zabbix[process,*,avg,busy]不低于 75% 为注意,不低于 90% 为异常
缓存使用率各类缓存的使用率 zabbix[*cache,*,pused]不低于 75% 为注意,不低于 90% 为异常
HA 节点HA 集群中各节点的状态没有 active 节点为异常。有节点不可用或已停止为注意。未启用 HA 为通过
Proxy 状态每个 proxy 最后一次通信距今的时长,以及版本兼容性300 秒为注意,1800 秒为异常。版本过旧为注意,不受支持为异常。未配置 proxy 为通过
不支持的监控项启用的监控项中处于不支持状态的数量存在即为注意。占比不低于 20% 为异常

阈值由 RST_OPS_* 配置项调整,见配置项参考。

本页内容