Global Search

搜索整个运维生态

一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。

Results

“监控告警”的搜索结果

31 条结果
  1. 知识

    Redis 内存压力与延迟诊断手册

    区分 maxmemory、进程 RSS、复制与 AOF 缓冲,使用有界慢日志和单键采样定位压力,明确驱逐策略、处置审批及数据回退限制。

    数据库与存储 · Redis 监控告警 高可用
  2. 知识

    Redis Sentinel 上线检查与切换演练

    检查 Sentinel 发现、认证、复制和客户端重连,在隔离环境演练主节点故障,验证拓扑收敛及可接受的数据恢复边界。

    数据库与存储 · Redis 监控告警 高可用
  3. 知识

    MySQL 复制延迟的定位方法

    结合复制线程、GTID、事务积压与资源指标分析 MySQL 复制延迟,区分接收异常、回放瓶颈和监控误判。

    数据库与存储 · MySQL 监控告警 高可用
  4. 知识

    YARN 应用排队与资源瓶颈排查

    围绕 Hadoop YARN 应用状态、队列配额、AM 资源和节点可放置性进行故障排查,定位资源空闲却无法调度的原因。

    大数据运维 · Hadoop 大数据 监控告警
  5. 知识

    HDFS 容量与副本健康巡检

    使用 HDFS 报告和指定路径检查,识别 DataNode 容量倾斜、副本不足与文件损坏,记录 Hadoop 集群的日常健康基线。

    大数据运维 · Hadoop 大数据 监控告警
  6. 知识

    Kubernetes Pod 异常排查手册

    从 Pending、CrashLoopBackOff 与探针失败入手,串联事件、容器日志和资源状态,建立 Kubernetes 故障排查的证据链。

    云原生与容器 · Kubernetes 监控告警
  7. 知识

    Uptime Kuma 可用性探测与通知验收

    从探测点网络、健康检查规则、通知演练和 data 目录备份出发,验收 Uptime Kuma 是否真能发现故障并安全展示状态页。

    监控与可观测 · Docker 告警治理 监控告警
  8. 知识

    PostgreSQL 复制与高可用故障只读诊断

    核对 PostgreSQL 主备角色、WAL 发送接收回放、复制槽与 Patroni 视图,区分复制故障、监控误读和高可用控制面异常。

    数据库与存储 · PostgreSQL 监控告警 高可用
  9. 知识

    StarRocks 物化视图刷新与数据新鲜度

    按任务链和分区覆盖解释 StarRocks 异步视图刷新,区分同步调用、透明重写与陈旧容忍,核对维表修订和业务截止点。

    大数据运维 · StarRocks 大数据 监控告警
  10. 知识

    StarRocks Query Profile 与冷热查询调优

    用查询 ID 和 ANALYZE PROFILE 关联实际执行,区分扫描、文件碎片、Join 倾斜、聚合与共享存储冷读,验证优化收益。

    大数据运维 · StarRocks 大数据 监控告警
  11. 知识

    StarRocks Stream Load 与主键更新实践

    核对 Stream Load 结果、Primary Key 与条件更新语义,辨别部分更新和 Merge Commit 的确认边界,防止乱序覆盖与重复推进。

    大数据运维 · StarRocks 大数据 监控告警
  12. 知识

    Kafka 消费积压与副本健康只读诊断

    联查消费组提交位点、分区分配、ISR 和 Broker 指标,识别消费端处理瓶颈、分区倾斜、重平衡与复制风险。

    大数据运维 · Kafka 大数据 监控告警 高可用
  13. 知识

    ClickHouse 增量物化视图与历史回填防重

    理解 ClickHouse 插入触发与目标表聚合,通过明确切点、隔离回填和批次清单核验历史覆盖,防止双路径重复及维表误判。

    大数据运维 · ClickHouse 大数据 监控告警
  14. 知识

    ClickHouse 副本巡检与备份恢复

    按本地表和分片巡检复制队列与 Keeper,核对原生备份依赖链,并在隔离目标验证恢复状态与业务样本。

    大数据运维 · ClickHouse 大数据 监控告警
  15. 知识

    ClickHouse 查询与内存瓶颈诊断

    关联 Query Log、运行中内存与 EXPLAIN,定位扫描、聚合、排序和 JOIN 放大,并验证分布式查询资源预算。

    大数据运维 · ClickHouse 大数据 监控告警
  16. 知识

    ClickHouse MergeTree 数据组织与建模

    从排序键、分区与数据 Part 设计分析表,解释 ReplacingMergeTree、重试去重和 TTL 的正确性及合并成本。

    大数据运维 · ClickHouse 大数据 监控告警
  17. 知识

    PostgreSQL 时间点恢复与数据验证手册

    核验完整基础备份、连续 WAL、timeline 和明确时区,在隔离空实例暂停到目标点,记录业务样本、恢复耗时及正式接管边界。

    数据库与存储 · PostgreSQL 监控告警 高可用
  18. 知识

    etcd 快照与隔离恢复验证手册

    以 etcd 3.6 核对快照完整性、新逻辑集群隔离、revision 与 watch 缓存边界,分阶段证明文件、服务和客户端可恢复性。

    云原生与容器 · Kubernetes 监控告警 高可用
  19. 知识

    Kubernetes DNS 与 Service 分层排障手册

    区分域名解析、Service 端点、后端应用与节点数据面问题,明确只读证据、获准探测、最小变更和访问隔离验收。

    云原生与容器 · Kubernetes 监控告警 高可用
  20. 知识

    HDFS DataNode 下线前后安全核验

    为 DataNode 退役检查节点身份、容量与故障域、块恢复和阻塞文件,明确何时可以交付停机以及必须暂停的条件。

    大数据运维 · Hadoop 大数据 监控告警 高可用