主机监控:快速开始与试点准备
明确方案边界、试点范围、采集权限和容量假设,建立可验证的主机监控验收清单。
方案状态与阅读方式
本页属于本次编写的主机监控集成方案档案,没有独立自研仓库、安装包或发布制品;尚未在目标环境部署或演练。它提供准备与验收方法,不代表已经具备采集、通知或自动修复能力。先完成本页,再阅读部署配置,最后按运行维护交接。
试点范围与负责人
选择一至两台非关键 Linux 主机,覆盖典型系统版本与挂载方式,登记资产编号、业务归属、维护窗口及原监控入口。node_exporter 负责主机指标,Prometheus 计算规则,Grafana 展示数据,Alertmanager 处理通知。应用响应时间与 Kubernetes 对象状态不在主机指标覆盖范围内;不能用主机正常推断业务正常。
前提与凭据边界
实施方需固定组件版本、包来源、架构及配置语法,确认系统时间同步、监控网络与证书信任。使用专用服务身份和最小读取权限;管理入口与指标端点只对授权来源开放。通知凭据交由既有密钥系统注入,不放入文档、命令历史或配置截图;登记轮换与吊销负责人。已有平台托管的监控应沿其配置入口变更,先排除重复采集。
只读基线检查
以下命令用于获准试点主机,仅观察当前运行状态,不安装服务。保存时间戳和脱敏后的结果,核对 CPU、内存、文件系统与已知异常。若环境没有对应命令,使用该系统获准的只读工具替代。
uname -r
getconf _NPROCESSORS_ONLN
free -b
df -hT
df -i采集器已经由实施方部署且本地端点获准访问时,可按 node_exporter 官方指南读取指标;读取成功仅证明端点响应,不证明看板与通知链路可用。
容量预算与接受条件
记录主机数、每台活跃序列、采集周期、保留期和峰值增长。以试点实测的内存与每日磁盘增量估算扩容,再单独预留压缩、查询和增长余量,不能用主机数量直接推算存储。限定标签为稳定资产维度,不把用户标识或请求编号作为标签;新增采集器必须记录权限、耗时和停用入口。
验证记录与停止条件
建议先约定连续三十分钟采集观察,再另行安排高峰期容量复查。抽样指标应与同一时段系统基线对应,关键挂载点不得无解释缺失;测试告警及恢复需由接收人确认。通知等待、分组和抑制共同影响时限,参见 Alertmanager 官方说明。这些都是待执行标准,不是本项目已完成结果。
停机、回退与后续
接入不要求业务停机,但服务安装、规则加载与通知测试仍须安排维护窗口。出现业务资源压力、采集权限越界或非测试告警被抑制时停止推广,撤回最近一批新增目标和规则,保留原监控与历史数据。不要填满生产磁盘制造告警。实施清单可对照 Linux 主机监控场景,告警设计补充阅读分级与降噪实践。