Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 知识
Prometheus 告警分级与降噪实践
以业务影响定义 Prometheus 告警级别,配置 Alertmanager 分组、抑制和静默,并验证通知、恢复与值班响应。
- 工具
Alertmanager
负责 Prometheus 告警的分组、抑制、静默与通知路由。
- 文档
Monitor 单机版:配置与探针使用
说明配置入口、各类探针判定、告警控制和报告计划,区分发送尝试与实际通知送达。
- 文档
Monitor-Gateway 运行维护:存储、排障与升级
围绕心跳、历史、规则、队列和对端排障,明确存储降级、热加载边界及升级恢复验收。
- 文档
Monitor 单机版:快速开始与试点准备
核对源码标记、主机与权限边界,建立采集、探针、通知和报告的试点验收清单。
- 文档
Monitor-Gateway 快速开始:网关与首台 Agent
规划单网关单节点试点,核对分权 Token、持久化、位置配置参数和心跳、历史及通知验收。
- 工具
Zabbix
通过 agent、SNMP、主动探测与 proxy 汇集主机、网络设备和服务状态,形成触发器与通知。
- 文档
主机监控:故障排查与值班交接
区分目标消失、抓取失败、通知断点及看板异常,以只读证据驱动处置和恢复签收。
- 工具
Uptime Kuma
自托管的服务可用性监控工具,支持 HTTP、TCP、Ping、DNS 与 Push 检测,集中查看响应时间、接收故障通知并发布状态页。
- 知识
Uptime Kuma 可用性探测与通知验收
从探测点网络、健康检查规则、通知演练和 data 目录备份出发,验收 Uptime Kuma 是否真能发现故障并安全展示状态页。
- 场景
站点可用性探测
用 Uptime Kuma 建立独立探测点,验收健康检查、故障通知、状态页和数据目录备份,而不是只确认首页能打开。
- 文档
主机监控:运行巡检与告警处置
以采集、规则、路由和容量四类证据定位异常,并定义维护静默、变更回退及交接要求。
- 文档
Monitor 单机版:运行维护与故障排查
整理日志预算、配置恢复、告警与报告验收、分层故障定位及退出时在途通知的能力边界。
- 文档
Monitor-Gateway 使用指南:规则、通知与报告
说明指标探针、告警来源模式、通道防风暴和报告调度,强调写操作授权与逐段结果核对。
- 场景
Kafka 集群监控
围绕 Kafka broker、KRaft 控制面与消费积压搭建受限指标采集,形成分级告警和可复核的业务基线。
- 场景
Kubernetes 集群监控
从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。
- 工具
Prometheus
面向基础设施与云原生环境的时序指标采集、查询和告警能力。
- 工具
Monitor 单机版
基于 Go 的单机指标与服务探针工具,覆盖阈值告警、恢复通知、多通道推送和定时报告;当前按源码能力收录,运行效果待环境验证。
- 项目
Monitor 单机版源码档案
整理单机指标采集、服务探针、多通道告警和定时报告的源码能力,配套试点准备、使用与运行维护手册。
- 工具
Monitor-Gateway
汇聚多节点主机指标与服务探针,提供中心告警、多通道通知、集群报告、持久化存储和 Web 控制台。