Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 场景
Redis 内存压力与延迟处置
区分 maxmemory、进程 RSS、复制与 AOF 缓冲,结合有界采样、慢日志和业务指标定位 Redis 内存压力及延迟。
- 场景
Redis Sentinel 高可用
从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。
- 场景
MySQL 主从高可用
围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。
- 场景
Hadoop 集群运维
结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。
- 场景
站点可用性探测
用 Uptime Kuma 建立独立探测点,验收健康检查、故障通知、状态页和数据目录备份,而不是只确认首页能打开。
- 场景
StarRocks 存算模式与导入查询运维
先辨别 shared-nothing 与 shared-data,再检查 FE、BE 或 CN、导入与主键更新、查询 Profile 和存储恢复边界。
- 场景
ClickHouse 合并、副本与查询运维
联查 MergeTree parts、查询内存、复制队列和备份恢复,区分本地表、分片与副本,完成有界诊断和隔离验收。
- 场景
PostgreSQL 时间点恢复演练
在隔离空实例中核验完整基础备份、连续 WAL 与时间线,按明确时区暂停至目标点,完成数据抽样和恢复证据交接。
- 场景
etcd 快照与隔离恢复演练
以 etcd 3.6 工具链验证快照可恢复性,覆盖完整性、隔离新集群、revision 边界、客户端验收和回退停止点。
- 场景
Kubernetes DNS 与 Service 连通性排障
从只读对象证据出发,分离 DNS、Service、后端与网络策略故障,经过授权探测和最小变更验证恢复。
- 场景
Kafka 集群监控
围绕 Kafka broker、KRaft 控制面与消费积压搭建受限指标采集,形成分级告警和可复核的业务基线。
- 场景
Kubernetes 集群监控
从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。
- 场景
Hive 分区治理与 SQL 执行运维
关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。
- 场景
Spark 作业诊断与流式恢复运维
从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。
- 场景
Flink 状态作业、检查点与反压运维
串联源位点、事件时间、算子状态、checkpoint 与 sink 提交,定位 Flink 反压和恢复失败并验证端到端结果。
- 场景
Doris 集群巡检与导入查询治理
从 FE 元数据、BE 副本、导入事务与查询 Profile 建立 Doris 分层巡检,验证数据可见性、容量余量与小范围调优效果。
- 场景
Iceberg 快照、写入与维护运维
理解 Iceberg 快照引用链与 Spark 提交,核对写入幂等、小文件维护、历史保留和清理恢复边界。
- 场景
日志集中管理
从日志字段、采集位点与缓冲预算到索引生命周期和端到端测试,建设能够衡量延迟、重复与丢失的日志链路。
- 场景
Hadoop DataNode 下线
以 HDFS 正式退役流程迁移 DataNode 副本,核对容量、机架与业务负载后再停止服务并交接资产。
- 场景
Linux 主机监控
从主机清单和指标基线出发,建立 CPU、内存、磁盘、网络与采集链路的可验证监控闭环。