Operations Playbooks

运维场景中心

从问题定位到恢复验收,查找适合当前环境的工具、实施步骤与回退方案。

查阅配套知识
34已发布场景来自公开发布内容
6内容分类全站可用能力分类
53已发布工具用于场景能力编排
34场景更新公开发布与重要变化

场景分类 / 能力领域

全部运维场景

共 21 个结果
当前条件:难度 高级清除全部

围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。

数据库与存储MySQL监控告警
工具 4步骤 7360 分钟

结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。

大数据运维Hadoop大数据
工具 4步骤 7300 分钟

从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。

数据库与存储Redis监控告警
工具 3步骤 7300 分钟

以 MySQL 单表为试点,核对 CDC 版本、增量快照与日志衔接、Schema 事件及目标提交,通过有限样本与隔离恢复验证同步边界。

大数据运维Apache FlinkApache Flink CDC
工具 3步骤 8180 分钟

关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。

大数据运维Apache Hive大数据
工具 2步骤 8180 分钟

从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。

大数据运维Apache Spark大数据
工具 1步骤 8180 分钟

从 FE 元数据、BE 副本、导入事务与查询 Profile 建立 Doris 分层巡检,验证数据可见性、容量余量与小范围调优效果。

大数据运维Apache Doris大数据
工具 1步骤 8180 分钟

从运行与回退镜像清单出发,区分标签保留、不可变规则和垃圾回收,通过双重试运行及冷拉取验收避免误删制品。

云原生与容器CI/CDDocker
工具 2步骤 8180 分钟

Latest Updates

最新场景更新

查看全部
  1. 新增站点可用性探测
  2. 新增Flink CDC 快照、结构演进与同步恢复
  3. 新增Iceberg 快照、写入与维护运维
  4. 新增Hive 分区治理与 SQL 执行运维
  5. 新增ClickHouse 合并、副本与查询运维

Scenario Method

方案构成 / 方法论

先明确环境与目标,再结合参考架构理解组件关系,按步骤验证与交接。

关联工具明确所需工具及其能力边界
架构图解理解组件职责、流向与故障域
实施步骤配置可执行的顺序与说明
验证回滚提供验证方式与回滚路径
场景体验按开放状态申请实践环境

DOUYA OPS ECOSYSTEM

体验豆芽自研工具与场景能力

部分场景提供体验环境,用于功能验证、测试和技术交流。