跳到主要内容

运维报告

日报、周报、月报:故障统计、恢复时长、设备可用性、链路容量与跑满预测、SLA 达标、AI 用量。按需生成,或定时生成、归档、推送。专业版及以上提供。

运维报告是 网络态势 页的一个标签,把一个周期内的运维数据汇成一份报告。报告、SLA、定时报告和巡检报告历史都属于 reports 功能,需要专业版或企业版许可,包括试用许可。没有许可时页面可以浏览,生成报告时弹出升级提示。

数据来自 Zabbix 的故障记录、接口流量趋势、ICMP ping 和 SLA,AI 用量来自网关的调用审计。报告由网关统计生成,不调用模型。

运维报告

生成报告

步骤

  1. 打开 运维报告,在 运维报告 标签的 选择报告周期 中选择 日报、周报 或 月报,分别覆盖过去 24 小时、7 天、30 天。月报包含 SLA。
  2. 等待几秒,报告生成后显示在下方。
  3. (可选)选择 重新生成 用最新数据再统计一次,或选择 下载 .md 保存 Markdown 全文。

某个数据源读取失败时,报告顶部列出失败的数据源,相关数字是占位零值,不代表实际为零。

报告内容

区块内容
执行摘要故障数(含未恢复和已确认数)、平均恢复时长(含平均确认时长)、平均可用性、高负载链路
故障严重度周期内故障按严重度分布
触发最多的触发器、故障最多的设备各取前 10
链路容量 Top N按小时趋势计算的入向、出向 P95 和利用率,取较忙的一侧
容量预测按线性趋势估算链路多久后跑满,只列 RST_REPORT_FORECAST_DAYS(默认 90)天内会跑满的链路
可用性最差的设备ICMP ping 在周期内的可达比例
SLA月报中的 SLA 达标情况,见下文
AI 用量调用次数、成功率、使用人数、平均耗时、按功能分布、使用最多的人
报告正文Markdown 全文

高负载链路指 P95 利用率不低于 RST_REPORT_LINK_BUSY_PCT(默认 80%)的链路。链路数据来自带趋势数据的 net.if.in 和 net.if.out 监控项,可用性来自 icmpping 监控项。没有这些监控项时,对应区块为空。

查看 SLA

SLA 标签读取 Zabbix 中配置的 SLA(Zabbix 的 服务 → SLA),列出每个服务的 SLI、SLO、停机时长和是否达标。

步骤

  1. 选择 SLA 标签。
  2. 选择一个 SLA 或 全部 SLA,再选择 统计周期。

Zabbix 中没有配置 SLA 时,页面提示先在 Zabbix 中配置。

定时生成报告

定时报告默认关闭。推荐在页面上开启:

步骤

  1. 打开 平台体检 → 对外通道,在 投递目标 标签的 推送排期 中选择推送周期。
  2. 选择发送时刻(小时)和时区,选择 保存排期。

保存后立即生效,不需要重启:日报每天、周报每周一、月报每月 1 日在该时刻生成。详见对外通道。

推送排期中没有选择任何周期时,改由网关环境变量决定:

RST_REPORT_SCHEDULE=daily,weekly,monthly

设置后重启网关容器。默认生成时间为每天 01:00(日报)、每周一 02:00(周报)、每月 1 日 03:00(月报),时区为 RST_REPORT_TZ,默认 UTC。可以用 RST_REPORT_CRON_DAILY、RST_REPORT_CRON_WEEKLY、RST_REPORT_CRON_MONTHLY 改为其他 cron 表达式。其他配置项见配置项参考。

定时报告出现在页面的 定时报告归档 中,保留 RST_REPORT_RETENTION_DAYS(默认 90)天。

推送报告

定时报告生成后,推送给对外通道中绑定了该周期的投递目标:飞书、钉钉、企业微信、Teams、Slack 或邮件。

巡检报告

巡检报告 标签列出巡检任务生成的报告,显示任务、生成时间、状态、最高严重度和发现数。选择一份报告查看全文。

本页内容