实时故障
通过轮询或 Zabbix Webhook 接入故障事件,每条生成一句 AI 摘要。在告警流中筛选、确认故障,对单条故障发起 AI 调查。接入、摘要和确认所有版本可用,AI 调查专业版及以上提供。
实时故障是 网络态势 页的一个标签。网关从 Zabbix 接入故障事件,为新故障生成一句 AI 摘要,通过实时推送显示在告警流中。接入、摘要、筛选和确认所有版本可用。AI 调查属于 alert_investigation 功能,需要专业版或企业版许可。

告警在网关中保存 RST_ALERTS_TTL_DAYS(默认 30 天)。AI 摘要使用 RST_OUTPUT_LANG 设置的语言。
告警接入
页面底部的 告警接入 显示两种接入方式的状态。两种方式可以同时开启,同一事件不会重复入库。
轮询拉取(event.get)
网关按间隔调用 event.get 拉取新的故障事件,并回扫已恢复的事件。轮询默认开启,参数由环境变量设置,修改后重启网关生效:
| 变量 | 默认值 | 说明 |
|---|---|---|
RST_ALERT_INGEST_POLL | 1 | 设为 0 关闭轮询 |
RST_ALERT_INGEST_INTERVAL_SECONDS | 15 | 轮询间隔,最小 3 秒 |
RST_ALERT_INGEST_GROUPS | 空(全部主机组) | 逗号分隔的主机组名 |
RST_ALERT_INGEST_LOOKBACK | 1h | 首次轮询回看的时长,例如 24h、7d |
Webhook 推送(Zabbix 媒介)
Zabbix 触发动作时立即把故障和恢复消息推到网关,没有轮询延迟。
前提条件
- 管理员角色(下载媒介类型文件需要)。
- Zabbix 管理员权限,用于导入媒介类型和创建动作。
步骤
- 在网关设置环境变量
RST_ALERT_WEBHOOK_SECRET(一段随机字符串)并重启。未设置时,接收端点拒绝所有推送。 - 在 告警接入 中选择 下载媒介类型,在 Zabbix 的 告警 → 媒介 中导入。
- 编辑媒介 RST Copilot:URL 填 推送地址 中显示的地址,Token 填第 1 步的 secret。网关设置了
RST_GATEWAY_SHARED_SECRET时填入 GatewayToken,否则留空。 - 给一个专用用户(例如
rst-copilot)添加该媒介,再建一个触发器动作,操作和恢复操作都向该用户发送消息。
Webhook 推来的告警所在主机不在主机组白名单内时,接入时直接丢弃,不入库。状态中显示 已丢弃 N 条(不在白名单内),计数从网关启动起算。
AI 摘要
每条新故障生成一句 AI 摘要,显示在告警流和详情中。
| 设置 | 默认值 | 说明 |
|---|---|---|
RST_ALERT_SUMMARY | 1 | 设为 0 关闭摘要 |
RST_ALERT_SUMMARY_MIN_SEVERITY | warning | 低于该严重度的故障不生成摘要 |
RST_ALERT_INGEST_BUDGET_S | 20 | 每轮接入的摘要时间预算(秒) |
告警风暴中,多台设备的故障被收敛为同一起事件时,共用一条摘要,只调用一次模型。一批告警超出时间预算时,超出的告警照常入库,详情中显示 超出摘要预算,未生成,接入状态显示 N 条未生成摘要。
查看告警概览
页面顶部的摘要卡显示所选时间窗内的故障告警数、严重以上的数量、已加载告警中尚未恢复的数量和实时推送状态。下方的 告警到达速率 和 严重度分布 可以切换 近 1 小时、近 6 小时、近 24 小时、近 7 天。页头可以按 主机组 筛选。
在告警流中处理告警
新故障实时出现在告警流顶部。向下滚动离开顶部或选择 暂停 时,新告警暂存在缓冲区,回到顶部或选择 继续 后显示。
步骤
- (可选)按 严重度、搜索触发器、时间范围或 只看未恢复 筛选。常用的筛选组合可以在 视图 中保存。
- (可选)打开 合并重复,同一触发器的重复告警折叠为一条。
- 选择一条告警,打开详情。
从网络态势的 最吵的触发器 或 最新告警 跳转过来时,告警流已按该触发器筛选或已打开该告警。

详情显示 AI 摘要、触发器、事件 ID、设备、发生和恢复时间、接入方式,以及 设备信息:主机组、接口及可用状态、资产信息和这台设备的当前故障。详情底部的操作:
| 操作 | 说明 | 要求 |
|---|---|---|
| AI 调查 | 见下文 | 专业版及以上 |
| 送去研判 | 把这条告警带到告警收敛 | 专业版及以上 |
| 确认故障 | 在 Zabbix 中确认该事件 | 分析员或管理员 |
| 在 Zabbix 中打开、设备故障列表 | 在 Zabbix 前端打开该事件或该设备的问题列表 | |
| 复制事件 ID |
在 Zabbix 中确认故障
前提条件
- 分析员或管理员角色,且管理员没有收回该角色的确认权限。
- 网关使用的 Zabbix API 账号对该主机有写权限。
步骤
- 在告警流中勾选一条或多条告警,选择 在 Zabbix 中确认。也可以在详情中选择 确认故障。
确认通过 event.acknowledge 写入 Zabbix,在 Zabbix 中记在网关的 API 账号名下,操作人记录在调用审计中。没有 Zabbix 事件 ID 的告警不能确认。
AI 调查
AI 调查由网络排查 Agent 执行:模型围绕这台设备多轮调用只读工具取证,最后给出结论。所有工具只读,范围固定在告警所在的主机组内。一次调查最多 6 轮(RST_AGENTIC_MAX_STEPS),总时长预算 180 秒(RST_AGENTIC_DEADLINE_S),超时后用已取到的证据给出结论。模型不支持 function calling,或设置了 RST_AGENTIC_INVESTIGATE=0 时,改为单步调查。
| 工具 | 查什么 |
|---|---|
| 接口流量 | 接口的入出流量、峰值,按接口带宽算出的利用率 |
| 接口错包 | 接口错包、丢包 |
| ICMP | ping 可达性、丢包率、响应时间 |
| 路由邻居 | BGP / OSPF 邻居状态 |
| 接口抖动 | 接口 up/down 变化 |
| 重启检查 | uptime 是否归零 |
| 设备健康 | CPU、内存、温度的当前值与窗口内均值和最大值 |
| 同类对比 | 与同组同模板的设备对比某个监控项,判断是个体异常还是普遍现象 |
| 邻近故障 | 同主机组其他主机在窗口内的问题,判断是否为上游或区域性故障 |
| 变更信号 | 见下文 |
除此之外,模型还可以执行只读的 Zabbix API 调用,校验规则与对话相同。
前提条件
- 专业版或企业版许可,包括试用许可。
- 告警所在主机属于主机组白名单内的某个主机组。
步骤
- 在告警详情中选择 AI 调查。
- 在打开的 故障调查 窗口中等待调查完成,通常需要 30 到 60 秒。
调查完成后显示报告,并自动归档到分析记录。报告顶部显示严重度、置信度、是否 疑似误报、Agent 轮数和拉取的上下文条数。报告包括结论、误报判定、时间线、影响链、受影响对象、处置建议 和 检索过程(agentic),后者列出每一步的调用和命中数,失败的步骤一并列出。
选择 导出故障报告(Markdown) 下载故障调查报告。要把结论推送到通知渠道,在分析记录中打开这条记录,选择 推送。
变更信号
「有人动过这台设备吗」是值班时的第一个问题。网关只用 Zabbix 已经采集的数据判断设备的变更,不登录设备,不保存设备凭据。AI 调查通过变更信号工具读取这些信号。
| 信号 | 判断依据 |
|---|---|
| 重启 | system.uptime、sysUpTime 或 hrSystemUptime 回落。32 位计数器约 497 天的回绕不算重启 |
| 固件变化 | sysDescr、操作系统或固件文本监控项的值变化 |
| 配置变更 | Cisco ccmHistoryRunningLastChanged / ccmHistoryStartupLastChanged 变化;华为配置变更 trap(hwCfgManEventlog、hwCfgChgNotify)监控项收到值;或带有配置变更标签的触发器事件,标签由 RST_CHANGE_TAGS 设置 |
| 接口抖动 | ifOperStatus 状态变化,3 次及以上标记为抖动 |
设备没有对应的监控项时,相应的信号不会出现。
远程 ping / traceroute
在拓扑中选择一台设备,可以从 Zabbix server 或 proxy 对它执行 ping 或 traceroute。需要专业版或企业版许可。