Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 知识
Redis 内存压力与延迟诊断手册
区分 maxmemory、进程 RSS、复制与 AOF 缓冲,使用有界慢日志和单键采样定位压力,明确驱逐策略、处置审批及数据回退限制。
- 知识
Redis Sentinel 上线检查与切换演练
检查 Sentinel 发现、认证、复制和客户端重连,在隔离环境演练主节点故障,验证拓扑收敛及可接受的数据恢复边界。
- 知识
MySQL 复制延迟的定位方法
结合复制线程、GTID、事务积压与资源指标分析 MySQL 复制延迟,区分接收异常、回放瓶颈和监控误判。
- 知识
YARN 应用排队与资源瓶颈排查
围绕 Hadoop YARN 应用状态、队列配额、AM 资源和节点可放置性进行故障排查,定位资源空闲却无法调度的原因。
- 知识
HDFS 容量与副本健康巡检
使用 HDFS 报告和指定路径检查,识别 DataNode 容量倾斜、副本不足与文件损坏,记录 Hadoop 集群的日常健康基线。
- 知识
Kubernetes Pod 异常排查手册
从 Pending、CrashLoopBackOff 与探针失败入手,串联事件、容器日志和资源状态,建立 Kubernetes 故障排查的证据链。
- 知识
Uptime Kuma 可用性探测与通知验收
从探测点网络、健康检查规则、通知演练和 data 目录备份出发,验收 Uptime Kuma 是否真能发现故障并安全展示状态页。
- 知识
PostgreSQL 复制与高可用故障只读诊断
核对 PostgreSQL 主备角色、WAL 发送接收回放、复制槽与 Patroni 视图,区分复制故障、监控误读和高可用控制面异常。
- 知识
StarRocks 物化视图刷新与数据新鲜度
按任务链和分区覆盖解释 StarRocks 异步视图刷新,区分同步调用、透明重写与陈旧容忍,核对维表修订和业务截止点。
- 知识
StarRocks Query Profile 与冷热查询调优
用查询 ID 和 ANALYZE PROFILE 关联实际执行,区分扫描、文件碎片、Join 倾斜、聚合与共享存储冷读,验证优化收益。
- 知识
StarRocks Stream Load 与主键更新实践
核对 Stream Load 结果、Primary Key 与条件更新语义,辨别部分更新和 Merge Commit 的确认边界,防止乱序覆盖与重复推进。
- 知识
Kafka 消费积压与副本健康只读诊断
联查消费组提交位点、分区分配、ISR 和 Broker 指标,识别消费端处理瓶颈、分区倾斜、重平衡与复制风险。
- 知识
ClickHouse 增量物化视图与历史回填防重
理解 ClickHouse 插入触发与目标表聚合,通过明确切点、隔离回填和批次清单核验历史覆盖,防止双路径重复及维表误判。
- 知识
ClickHouse 副本巡检与备份恢复
按本地表和分片巡检复制队列与 Keeper,核对原生备份依赖链,并在隔离目标验证恢复状态与业务样本。
- 知识
ClickHouse 查询与内存瓶颈诊断
关联 Query Log、运行中内存与 EXPLAIN,定位扫描、聚合、排序和 JOIN 放大,并验证分布式查询资源预算。
- 知识
ClickHouse MergeTree 数据组织与建模
从排序键、分区与数据 Part 设计分析表,解释 ReplacingMergeTree、重试去重和 TTL 的正确性及合并成本。
- 知识
PostgreSQL 时间点恢复与数据验证手册
核验完整基础备份、连续 WAL、timeline 和明确时区,在隔离空实例暂停到目标点,记录业务样本、恢复耗时及正式接管边界。
- 知识
etcd 快照与隔离恢复验证手册
以 etcd 3.6 核对快照完整性、新逻辑集群隔离、revision 与 watch 缓存边界,分阶段证明文件、服务和客户端可恢复性。
- 知识
Kubernetes DNS 与 Service 分层排障手册
区分域名解析、Service 端点、后端应用与节点数据面问题,明确只读证据、获准探测、最小变更和访问隔离验收。
- 知识
HDFS DataNode 下线前后安全核验
为 DataNode 退役检查节点身份、容量与故障域、块恢复和阻塞文件,明确何时可以交付停机以及必须暂停的条件。