巡检
按主机组和检查项定时巡检:指标阈值、主机可用性、未恢复故障汇总,与上一轮比较,生成带 AI 处置建议的报告并推送。专业版及以上提供。
巡检按 cron 定时检查一组主机,每次运行生成一份报告并推送到群机器人或邮件,超过阈值时报告标红,位于侧栏 网络运维 组。手动巡检、定时巡检和巡检报告历史都属于 reports 功能,需要专业版或企业版许可,包括试用许可。没有许可时可以浏览和配置,运行时弹出升级提示。
修改巡检配置需要管理员角色。立即巡检 需要分析员或管理员角色。

添加检查项
检查项是巡检的最小单位,在任务中勾选后才会执行。
步骤
-
在 检查项 标签中选择 新增检查项。
-
输入 ID,选择 类型:
类型 检查内容 指标阈值 某个监控项 key 的最新值与阈值比较 主机可用性 主机的接口是否全部不可达 故障汇总 列出当前未恢复的故障 -
指标阈值类型需要填写 监控项 key。可以选择 拉取候选,从 Zabbix 拉取 key 后在输入框中下拉选择。
-
选择 比较 方式、输入 阈值,选择 级别:严重、高、中或低。
-
(可选)输入 主机组。留空时沿用任务的主机组。
-
选择 添加。
设置报告模板
报告模板 决定报告包含哪些章节、何时标为超阈值,以及 AI 建议的语气。
| 项 | 说明 |
|---|---|
| 报告标题 | 报告和推送卡片的标题 |
| 包含章节 | 概览、环比(与上一轮相比新增、已恢复、持续的异常)、异常指标、故障、AI 处置建议 |
| 告警阈值 | 有异常且最高级别不低于这一档时,报告标为 超阈值,推送卡片转红 |
| AI 语气 | 生成处置建议时使用的 system prompt |
AI 处置建议由模型根据本轮发现和环比变化生成。模型调用失败时,报告照常生成,建议处注明生成失败。
新建巡检任务
步骤
- 在 巡检任务 标签中设置 时区。cron 按这个时区解析。北京时间填
Asia/Shanghai;留空即 UTC,与北京时间相差 8 小时。 - 选择 新增任务,输入 名称,例如「核心网络每日巡检」。
- 输入 cron,5 段格式,例如
0 8 * * *是每天 8 点。留空表示只手动运行。 - 选择 主机组(或 全部主机组)、报告模板 和要执行的 检查项。
- 在 通知到 中选择推送目标。
- 打开 启用定时。
- 选择 保存并生效。保存后调度立即重载。
新任务保存后,可以选择 立即巡检 验证一次。
选择推送目标
通知到 可以选两类目标:
- 对外通道中的投递目标:飞书、钉钉、企业微信、Teams、Slack 或邮件。推送走统一的投递队列,失败自动重试,在投递记录中可以查看。新配置建议使用这一类。
- 通知渠道 标签中的 巡检自带飞书 webhook。这是早期版本的配置方式,仍然可用。
巡检自带飞书 webhook 的地址和签名密钥加密保存,保存后不再显示:已设置的 webhook 只显示主机名(「已设置(主机名),留空不改」),已保存的密钥不回显,留空即保留原值;选中 清除已设置的密钥(改为无签名) 可以去掉签名。升级前的明文记录在下一次保存巡检配置时自动加密。
查看巡检报告
报告历史 标签列出每次巡检的结果。选择 查看 打开报告,可以 复制 Markdown 或 下载 .md。运维报告的 巡检报告 标签显示同一份历史。
| 结果 | 含义 |
|---|---|
| 正常 | 没有达到模板告警阈值的异常 |
| 部分失败 | 有检查项执行出错,其余正常 |
| 超阈值 | 有异常,且最高级别不低于模板的告警阈值 |