Global Search

搜索整个运维生态

一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。

Results

“监控告警”的搜索结果

21 条结果
  1. 场景

    Redis 内存压力与延迟处置

    区分 maxmemory、进程 RSS、复制与 AOF 缓冲,结合有界采样、慢日志和业务指标定位 Redis 内存压力及延迟。

    数据库与存储 · Redis 监控告警 高可用
  2. 场景

    Redis Sentinel 高可用

    从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。

    数据库与存储 · Redis 监控告警 高可用
  3. 场景

    MySQL 主从高可用

    围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。

    数据库与存储 · MySQL 监控告警 高可用
  4. 场景

    Hadoop 集群运维

    结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。

    大数据运维 · Hadoop 大数据 监控告警
  5. 场景

    站点可用性探测

    用 Uptime Kuma 建立独立探测点,验收健康检查、故障通知、状态页和数据目录备份,而不是只确认首页能打开。

    监控与可观测 · Docker 告警治理 监控告警
  6. 场景

    StarRocks 存算模式与导入查询运维

    先辨别 shared-nothing 与 shared-data,再检查 FE、BE 或 CN、导入与主键更新、查询 Profile 和存储恢复边界。

    大数据运维 · StarRocks 大数据 监控告警
  7. 场景

    ClickHouse 合并、副本与查询运维

    联查 MergeTree parts、查询内存、复制队列和备份恢复,区分本地表、分片与副本,完成有界诊断和隔离验收。

    大数据运维 · ClickHouse 大数据 监控告警
  8. 场景

    PostgreSQL 时间点恢复演练

    在隔离空实例中核验完整基础备份、连续 WAL 与时间线,按明确时区暂停至目标点,完成数据抽样和恢复证据交接。

    数据库与存储 · PostgreSQL 监控告警 高可用
  9. 场景

    etcd 快照与隔离恢复演练

    以 etcd 3.6 工具链验证快照可恢复性,覆盖完整性、隔离新集群、revision 边界、客户端验收和回退停止点。

    云原生与容器 · Kubernetes 监控告警 高可用
  10. 场景

    Kubernetes DNS 与 Service 连通性排障

    从只读对象证据出发,分离 DNS、Service、后端与网络策略故障,经过授权探测和最小变更验证恢复。

    云原生与容器 · Kubernetes 监控告警 高可用
  11. 场景

    Kafka 集群监控

    围绕 Kafka broker、KRaft 控制面与消费积压搭建受限指标采集,形成分级告警和可复核的业务基线。

    监控与可观测 · Kafka 告警治理 监控告警 高可用
  12. 场景

    Kubernetes 集群监控

    从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。

    云原生与容器 · Kubernetes 告警治理 监控告警
  13. 场景

    Hive 分区治理与 SQL 执行运维

    关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。

    大数据运维 · Apache Hive 大数据 监控告警
  14. 场景

    Spark 作业诊断与流式恢复运维

    从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。

    大数据运维 · Apache Spark 大数据 监控告警
  15. 场景

    Flink 状态作业、检查点与反压运维

    串联源位点、事件时间、算子状态、checkpoint 与 sink 提交,定位 Flink 反压和恢复失败并验证端到端结果。

    大数据运维 · Apache Flink 大数据 监控告警
  16. 场景

    Doris 集群巡检与导入查询治理

    从 FE 元数据、BE 副本、导入事务与查询 Profile 建立 Doris 分层巡检,验证数据可见性、容量余量与小范围调优效果。

    大数据运维 · Apache Doris 大数据 监控告警
  17. 场景

    Iceberg 快照、写入与维护运维

    理解 Iceberg 快照引用链与 Spark 提交,核对写入幂等、小文件维护、历史保留和清理恢复边界。

    大数据运维 · Apache Iceberg 大数据 监控告警
  18. 场景

    日志集中管理

    从日志字段、采集位点与缓冲预算到索引生命周期和端到端测试,建设能够衡量延迟、重复与丢失的日志链路。

    监控与可观测 · Elasticsearch 日志管理 监控告警
  19. 场景

    Hadoop DataNode 下线

    以 HDFS 正式退役流程迁移 DataNode 副本,核对容量、机架与业务负载后再停止服务并交接资产。

    大数据运维 · Hadoop Linux 监控告警 自动化 高可用
  20. 场景

    Linux 主机监控

    从主机清单和指标基线出发,建立 CPU、内存、磁盘、网络与采集链路的可验证监控闭环。

    监控与可观测 · Linux Prometheus 告警治理 监控告警