跳到主要内容

实时故障

通过轮询或 Zabbix Webhook 接入故障事件,每条生成一句 AI 摘要。在告警流中筛选、确认故障,对单条故障发起 AI 调查。接入、摘要和确认所有版本可用,AI 调查专业版及以上提供。

实时故障是 网络态势 页的一个标签。网关从 Zabbix 接入故障事件,为新故障生成一句 AI 摘要,通过实时推送显示在告警流中。接入、摘要、筛选和确认所有版本可用。AI 调查属于 alert_investigation 功能,需要专业版或企业版许可。

实时故障

告警在网关中保存 RST_ALERTS_TTL_DAYS(默认 30 天)。AI 摘要使用 RST_OUTPUT_LANG 设置的语言。

告警接入

页面底部的 告警接入 显示两种接入方式的状态。两种方式可以同时开启,同一事件不会重复入库。

轮询拉取(event.get)

网关按间隔调用 event.get 拉取新的故障事件,并回扫已恢复的事件。轮询默认开启,参数由环境变量设置,修改后重启网关生效:

变量默认值说明
RST_ALERT_INGEST_POLL1设为 0 关闭轮询
RST_ALERT_INGEST_INTERVAL_SECONDS15轮询间隔,最小 3 秒
RST_ALERT_INGEST_GROUPS空(全部主机组)逗号分隔的主机组名
RST_ALERT_INGEST_LOOKBACK1h首次轮询回看的时长,例如 24h、7d

Webhook 推送(Zabbix 媒介)

Zabbix 触发动作时立即把故障和恢复消息推到网关,没有轮询延迟。

前提条件

  • 管理员角色(下载媒介类型文件需要)。
  • Zabbix 管理员权限,用于导入媒介类型和创建动作。

步骤

  1. 在网关设置环境变量 RST_ALERT_WEBHOOK_SECRET(一段随机字符串)并重启。未设置时,接收端点拒绝所有推送。
  2. 在 告警接入 中选择 下载媒介类型,在 Zabbix 的 告警 → 媒介 中导入。
  3. 编辑媒介 RST Copilot:URL 填 推送地址 中显示的地址,Token 填第 1 步的 secret。网关设置了 RST_GATEWAY_SHARED_SECRET 时填入 GatewayToken,否则留空。
  4. 给一个专用用户(例如 rst-copilot)添加该媒介,再建一个触发器动作,操作和恢复操作都向该用户发送消息。

Webhook 推来的告警所在主机不在主机组白名单内时,接入时直接丢弃,不入库。状态中显示 已丢弃 N 条(不在白名单内),计数从网关启动起算。

AI 摘要

每条新故障生成一句 AI 摘要,显示在告警流和详情中。

设置默认值说明
RST_ALERT_SUMMARY1设为 0 关闭摘要
RST_ALERT_SUMMARY_MIN_SEVERITYwarning低于该严重度的故障不生成摘要
RST_ALERT_INGEST_BUDGET_S20每轮接入的摘要时间预算(秒)

告警风暴中,多台设备的故障被收敛为同一起事件时,共用一条摘要,只调用一次模型。一批告警超出时间预算时,超出的告警照常入库,详情中显示 超出摘要预算,未生成,接入状态显示 N 条未生成摘要。

查看告警概览

页面顶部的摘要卡显示所选时间窗内的故障告警数、严重以上的数量、已加载告警中尚未恢复的数量和实时推送状态。下方的 告警到达速率 和 严重度分布 可以切换 近 1 小时、近 6 小时、近 24 小时、近 7 天。页头可以按 主机组 筛选。

在告警流中处理告警

新故障实时出现在告警流顶部。向下滚动离开顶部或选择 暂停 时,新告警暂存在缓冲区,回到顶部或选择 继续 后显示。

步骤

  1. (可选)按 严重度、搜索触发器、时间范围或 只看未恢复 筛选。常用的筛选组合可以在 视图 中保存。
  2. (可选)打开 合并重复,同一触发器的重复告警折叠为一条。
  3. 选择一条告警,打开详情。

从网络态势的 最吵的触发器 或 最新告警 跳转过来时,告警流已按该触发器筛选或已打开该告警。

告警详情

详情显示 AI 摘要、触发器、事件 ID、设备、发生和恢复时间、接入方式,以及 设备信息:主机组、接口及可用状态、资产信息和这台设备的当前故障。详情底部的操作:

操作说明要求
AI 调查见下文专业版及以上
送去研判把这条告警带到告警收敛专业版及以上
确认故障在 Zabbix 中确认该事件分析员或管理员
在 Zabbix 中打开、设备故障列表在 Zabbix 前端打开该事件或该设备的问题列表
复制事件 ID

在 Zabbix 中确认故障

前提条件

  • 分析员或管理员角色,且管理员没有收回该角色的确认权限。
  • 网关使用的 Zabbix API 账号对该主机有写权限。

步骤

  1. 在告警流中勾选一条或多条告警,选择 在 Zabbix 中确认。也可以在详情中选择 确认故障。

确认通过 event.acknowledge 写入 Zabbix,在 Zabbix 中记在网关的 API 账号名下,操作人记录在调用审计中。没有 Zabbix 事件 ID 的告警不能确认。

AI 调查

AI 调查由网络排查 Agent 执行:模型围绕这台设备多轮调用只读工具取证,最后给出结论。所有工具只读,范围固定在告警所在的主机组内。一次调查最多 6 轮(RST_AGENTIC_MAX_STEPS),总时长预算 180 秒(RST_AGENTIC_DEADLINE_S),超时后用已取到的证据给出结论。模型不支持 function calling,或设置了 RST_AGENTIC_INVESTIGATE=0 时,改为单步调查。

工具查什么
接口流量接口的入出流量、峰值,按接口带宽算出的利用率
接口错包接口错包、丢包
ICMPping 可达性、丢包率、响应时间
路由邻居BGP / OSPF 邻居状态
接口抖动接口 up/down 变化
重启检查uptime 是否归零
设备健康CPU、内存、温度的当前值与窗口内均值和最大值
同类对比与同组同模板的设备对比某个监控项,判断是个体异常还是普遍现象
邻近故障同主机组其他主机在窗口内的问题,判断是否为上游或区域性故障
变更信号见下文

除此之外,模型还可以执行只读的 Zabbix API 调用,校验规则与对话相同。

前提条件

  • 专业版或企业版许可,包括试用许可。
  • 告警所在主机属于主机组白名单内的某个主机组。

步骤

  1. 在告警详情中选择 AI 调查。
  2. 在打开的 故障调查 窗口中等待调查完成,通常需要 30 到 60 秒。

调查完成后显示报告,并自动归档到分析记录。报告顶部显示严重度、置信度、是否 疑似误报、Agent 轮数和拉取的上下文条数。报告包括结论、误报判定、时间线、影响链、受影响对象、处置建议 和 检索过程(agentic),后者列出每一步的调用和命中数,失败的步骤一并列出。

选择 导出故障报告(Markdown) 下载故障调查报告。要把结论推送到通知渠道,在分析记录中打开这条记录,选择 推送。

变更信号

「有人动过这台设备吗」是值班时的第一个问题。网关只用 Zabbix 已经采集的数据判断设备的变更,不登录设备,不保存设备凭据。AI 调查通过变更信号工具读取这些信号。

信号判断依据
重启system.uptime、sysUpTime 或 hrSystemUptime 回落。32 位计数器约 497 天的回绕不算重启
固件变化sysDescr、操作系统或固件文本监控项的值变化
配置变更Cisco ccmHistoryRunningLastChanged / ccmHistoryStartupLastChanged 变化;华为配置变更 trap(hwCfgManEventlog、hwCfgChgNotify)监控项收到值;或带有配置变更标签的触发器事件,标签由 RST_CHANGE_TAGS 设置
接口抖动ifOperStatus 状态变化,3 次及以上标记为抖动

设备没有对应的监控项时,相应的信号不会出现。

远程 ping / traceroute

在拓扑中选择一台设备,可以从 Zabbix server 或 proxy 对它执行 ping 或 traceroute。需要专业版或企业版许可。

本页内容