主机监控:运行巡检与告警处置
以采集、规则、路由和容量四类证据定位异常,并定义维护静默、变更回退及交接要求。
使用前提与运行状态
本手册为集成方案的运行规程草案,目标环境部署与演练尚未执行。只有实施方完成验收并填写实际配置版本、负责人、看板地址及凭据入口后,才能据此开展值班。不得把本页内容当作已经可用的监控服务或自动故障修复能力。部署前置条件见部署配置。
日常巡检与证据
先检查资产清单与 targets 是否一致,再看抓取错误、规则执行、通知失败、存储增长和维护静默。巡检结果保留时间范围与查询条件,区分数值为零、目标未采集和查询无结果。以下 PromQL 仅供已登录的授权查询入口使用;将 job 替换为实际值,查询窗口应长于若干采集周期。
up{job="linux-hosts-pilot"}
scrape_duration_seconds{job="linux-hosts-pilot"}
count by (job) (up{job="linux-hosts-pilot"})若目标被发现规则移除,它可能不再出现在 up 结果中,因此必须与资产清单比对。查询接口与参数可查 Prometheus HTTP API,不得把管理令牌直接贴入诊断记录。
采集缺口排查
从指定目标的最近错误开始,分别核对服务状态、授权网络、证书到期、端点耗时及标签变更。端点能返回数据后仍要检查指标口径与关键挂载点;如果只有看板为空,先比对时间范围、数据源和变量,不急于重启采集服务。调整需进入变更记录,优先恢复最近配置差异,不对无证据的主机批量操作。
告警与通知处置
确认规则是否真正触发,再追踪分组、路由、抑制、静默及接收端结果。通知系统已接受不等于值班人已收到;需使用独立测试标签验证触发与恢复。维护静默须限定对象、责任人和到期时间。分组与抑制语义参见 Alertmanager 文档,本地策略可对照告警分级与降噪。
容量与凭据维护
每次扩容比较每台主机序列数、抓取耗时、查询负载和磁盘增长;若增长主要来自标签或新采集器,应先定位来源。保留期调整涉及历史证据,应单独审批并告知使用方。证书、数据源身份和通知令牌分开轮换,先验证新凭据,再收回旧授权;只读查询账号不得获得规则或数据源管理权限。看板若采用文件预置,应从配置源变更,避免页面修改被后续覆盖,参见 Grafana 预置文档。
停机窗口与恢复边界
计划升级监控组件应说明采集和通知可能中断的时间,保留独立故障通知渠道,不承诺业务不停机就等于监控无中断。升级前检查实际版本支持的恢复路径,数据格式变更不默认可降级。新规则或新目标有问题时仅撤回相应批次;若需回退组件,按已评审备份与版本策略执行,不能删除时序数据强制启动。
交接与复盘
交接包含资产覆盖例外、规则及看板版本、凭据责任人、容量观察结果和未完成演练。由未参与搭建者从一条测试告警定位目标、最近变更和升级联系人,记录实际耗时与障碍。恢复后确认旧链路仍可用、测试静默已回收、真实事件未被关闭;不满足条件时保持待验证状态并暂停新增接入。