Monitor-Gateway 运行维护:存储、排障与升级
围绕心跳、历史、规则、队列和对端排障,明确存储降级、热加载边界及升级恢复验收。
值班职责与验证范围
本手册依据 2026-09-08 源码审阅整理,未执行节点中断、存储恢复、通知演练或升级。值班时分别观察 Agent、Gateway、持久化、规则、队列和通知对端;其中一环可用不代表整条链路正常。
当前资料不承诺多实例高可用、自动修复或无损补传。试点未完成快速开始验收前,不将本站文档作为生产上线批准。
日常巡检与容量
检查节点心跳年龄、最新指标与历史入库时间、活跃告警、队列失败或限速、通知对端及报告调度。对长期离线节点核对维护状态和业务归属,不只调整离线阈值来消除提示。
记录实际存储后端、磁盘增长、保留期和每节点历史上限。启用历史精简与批量写入后,应在试点验证查询字段和延迟;不要把参数存在当作已完成容量压测。Memory 不持久化,发现 SQLite/MySQL 降级时应停止新增节点并排查原因。
常见异常与证据顺序
- Agent 上报被拒绝:核对 Token 权限、来源限制、监听地址与错误状态;不要关闭认证来恢复连通。
- 节点在线但历史为空:比较上报、存储实际后端、查询时间窗与节点筛选,确认已经经历足够采样周期。
- 有指标没有告警:检查规则模式、本地阈值开关、中心范围和连续条件,再核对指标单位。
- 有告警没有通知:检查启用通道、占位配置、静默、限速、队列错误及对端反馈;不要连续向真实群重复测试。
- 网络数值不合理:区分累计字节和吞吐率,历史 MB/s 需与对应采样时段比较。
- 报告未发送:检查时区、定点/间隔、报告开关与全绿跳过,先查询调度再考虑手动发送。
配置热加载与重启边界
通知、规则、防风暴、节点超时、安全配置和报告调度存在热加载逻辑,可通过已授权管理入口或 SIGHUP 触发。热加载会重新建立部分运行对象,需观察生效规则、路由和后续通知,不只看请求返回码。
监听地址、Web 端口、存储类型或路径、TLS 开关、队列及批量尺寸等变更需要重启。先保存配置和运行摘要,再分阶段执行,保留原有监控链路与通知接收人。重启可能造成采样缺口,恢复后应标注缺口,而不是填补或伪造历史值。
备份、升级与回退
备份配置与数据库时遵循所选存储的备份方式,确保一致性和秘密保护,并在独立环境验证可读取历史、节点及告警信息。只复制正在写入的数据库文件未必构成可靠备份;保留实际后端、版本与备份时间记录。
升级先在单网关和单 Agent 试点核对协议、指标字段、历史单位与规则行为,避免将 Agent 和 Gateway 不兼容的问题扩散。保存旧制品与配置,检查数据库兼容后才批准回退;不通过删除数据库或改成 Memory 绕过持久化问题。版本字段来自构建注入,根 VERSION 标记不能替代运行制品的版本证据。
恢复验收与交接资料
恢复后逐项确认心跳、指标、历史、中心规则、测试告警、恢复通知和报告调度。记录没有恢复的数据时间窗、通知失败与未完成节点,防止把告警数量下降误判为问题消失。资源异常、身份冲突、持久化退化或通知对象错误时暂停后续推广。
实现依据可查 internal/storage/factory.go、internal/gw/reload.go、internal/notify/queue.go 与 main.go。继续阅读使用指南、主机资源排障知识和告警治理知识。这些是运行方法参考,不等同于已完成的集成、部署或演练。