场景分类 / 能力领域
全部运维场景
共 21 个结果从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。
围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。
结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。
日志集中管理
进阶从日志字段、采集位点与缓冲预算到索引生命周期和端到端测试,建设能够衡量延迟、重复与丢失的日志链路。
从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。
站点可用性探测
入门用 Uptime Kuma 建立独立探测点,验收健康检查、故障通知、状态页和数据目录备份,而不是只确认首页能打开。
理解 Iceberg 快照引用链与 Spark 提交,核对写入幂等、小文件维护、历史保留和清理恢复边界。
关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。
联查 MergeTree parts、查询内存、复制队列和备份恢复,区分本地表、分片与副本,完成有界诊断和隔离验收。
从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。
串联源位点、事件时间、算子状态、checkpoint 与 sink 提交,定位 Flink 反压和恢复失败并验证端到端结果。
先辨别 shared-nothing 与 shared-data,再检查 FE、BE 或 CN、导入与主键更新、查询 Profile 和存储恢复边界。
Latest Updates
最新场景更新
Scenario Method
方案构成 / 方法论
先明确环境与目标,再结合参考架构理解组件关系,按步骤验证与交接。