平台体检
检查 Zabbix 自身:版本、自监控数据、监控队列、进程繁忙度、缓存使用率、HA 节点、proxy 状态、不支持的监控项。AI 解读把未通过的项归因并给出修复顺序。专业版及以上提供。
平台体检检查 Zabbix server 本身:数据是否按时采集、poller 和缓存够不够用、proxy 和 HA 节点是否在线。体检只调用 Zabbix API 读取数据。体检和 AI 解读都属于平台运维助手(platform_ops_copilot),需要专业版或企业版许可,包括试用许可。体检结论和 AI 解读都跟随界面语言。社区版可以打开本页浏览(预览),不执行体检,选择 重新体检 时弹出升级提示。

执行体检
步骤
- 打开 平台体检,页面自动执行一轮体检。
- 修复问题后,选择 重新体检。
体检概览 给出一句结论和三项计数:通过、需处理(异常与注意)、查不了(API 权限不足或缺少内部监控项)。检查项明细 按需处理、通过、查不了分组,每项显示判定、检查结果和修复建议。
查不了 不是错误,常见原因有两个:
- 队列、进程、缓存三项读取 Zabbix server 的内部监控项(
zabbix[...])。确认主机「Zabbix server」已链接模板「Zabbix server health」,且网关使用的 API 账号对该主机有读权限。主机名不同时,设置RST_ZABBIX_SERVER_HOST。 - HA 节点一项调用
hanode.get,需要超级管理员权限。权限说明见 Zabbix 权限。
获取 AI 解读
各检查项单独看都有结论和建议,模型的作用是把它们串起来:例如 unreachable poller 繁忙、队列增长、某个 proxy 失联,往往是同一个原因(某个站点的链路断了)。AI 解读说明哪几项属于同一个根因、先修什么、怎么修。
前提条件
- 专业版或企业版许可,包括试用许可。
步骤
- 体检有未通过的项时,在页面右上角选择 AI 解读。

各项都通过时不显示 AI 解读,也不调用模型。配置了知识库时,模型会检索相关文档,结果中注明 参考了知识库。模型没有返回可用结果时,页面按检查项本身的严重程度排序显示。
检查项
| 检查项 | 检查内容 | 判定 |
|---|---|---|
| Zabbix 版本 | apiinfo.version 返回的版本 | 低于 6.0 为注意(官方已停止支持)。6.x 中非 6.0 LTS 的版本为注意 |
| 自监控数据 | Zabbix server 的内部监控项是否在更新 | 超过 RST_OPS_INTERNAL_STALE_S(默认 900 秒)没有更新为异常。找不到内部监控项或有不支持的内部监控项为注意 |
| 监控队列 | zabbix[queue,10m]:延迟超过 10 分钟的监控项数 | 不少于 1 为注意,不少于 100 为异常 |
| 进程繁忙度 | 各类进程的平均繁忙度 zabbix[process,*,avg,busy] | 不低于 75% 为注意,不低于 90% 为异常 |
| 缓存使用率 | 各类缓存的使用率 zabbix[*cache,*,pused] | 不低于 75% 为注意,不低于 90% 为异常 |
| HA 节点 | HA 集群中各节点的状态 | 没有 active 节点为异常。有节点不可用或已停止为注意。未启用 HA 为通过 |
| Proxy 状态 | 每个 proxy 最后一次通信距今的时长,以及版本兼容性 | 300 秒为注意,1800 秒为异常。版本过旧为注意,不受支持为异常。未配置 proxy 为通过 |
| 不支持的监控项 | 启用的监控项中处于不支持状态的数量 | 存在即为注意。占比不低于 20% 为异常 |
阈值由 RST_OPS_* 配置项调整,见配置项参考。