主机监控:部署配置与分批接入
给出采集候选配置、变更顺序和恢复点要求,区分语法检查与真实链路验收。
文档状态与变更入口
本页是实验性集成方案的部署说明,不包含已部署系统或可直接安装的发布制品。实施前先完成试点准备,提交目标、窗口、负责人和停止阈值。所有 <...> 均为必换占位符;示例必须按实际版本审阅,不能整段覆盖现有配置。
版本、权限与恢复材料
固定 node_exporter、Prometheus、Grafana、Alertmanager 的版本和校验过的软件来源。为采集服务创建专用身份,逐项确认额外采集器权限,不默认授予管理权限。保存现有服务参数、发现配置、规则、通知路由及看板导出,登记恢复顺序。证书和通知令牌由受控文件或既有密钥机制供应,备份中不得包含明文秘密。
试点 exporter 与网络
先在一台代表性主机按既有包管理或服务管理流程安装;本项目不提供安装脚本。限制采集端口来源,确认 TLS 或可信隔离网络方案。容器化部署需核对宿主机目录和命名空间视角,避免展示容器自身指标。观察三个采集周期,对照准备阶段的 CPU 数、内存与挂载点,再允许 Prometheus 接入。
采集候选配置与预检
以下是合并到既有 scrape_configs 的候选片段,不是完整生产配置。示例假定获准 HTTPS 指标端点已存在,证书文件可由 Prometheus 身份读取;若还需认证,按环境补齐,禁止关闭证书校验。三十秒周期与十秒超时仅为试点起点,须结合目标耗时评审。
scrape_configs:
- job_name: linux-hosts-pilot
scrape_interval: 30s
scrape_timeout: 10s
scheme: https
tls_config:
ca_file: '<CA_FILE>'
static_configs:
- targets: ['<EXPORTER_DNS>:9100']
labels:
environment: '<ENVIRONMENT>'
owner: '<TEAM>'加载前仅运行下列本地预检。配置语义和加载机制参见 Prometheus 配置文档,检查子命令参见 promtool 文档。成功退出不等于目标可达。
promtool check config '<CANDIDATE_CONFIG>'
promtool check rules '<CANDIDATE_RULES>'看板、路由与容量门槛
经现有发布流程加载后,先确认试点 job 没有重复目标,再记录活跃序列、抓取耗时、内存和磁盘增量。Grafana 看板统一单位、时区和资产变量,明确无数据状态;候选规则只路由测试接收组。分别核对主机失联、磁盘空间和 inode 规则,不能只验证一条通知即宣称全覆盖。容量超过预算时减少新增范围,不能擅自删除历史数据腾空间。另行选择非高峰与业务高峰两个观察窗口,保存接入前后对照,说明查询负载和后台任务的差异,避免把短时低负载误当长期容量结论。
分批验收与回退
每批记录接入清单、配置版本、观察时间和测试通知证据,合格后才进入下一批。通常不需要业务停机,但新增服务异常占用资源、规则持续失败或错误路由影响值班时应立即停止。恢复最近一批配置及服务版本,保留上批已验证目标;通知误发需说明测试身份,不使用全局静默掩盖问题。回退不包括删除时序库;恢复完成后按运行手册核验采集与告警链路。