Operations Playbooks

运维场景中心

从问题定位到恢复验收,查找适合当前环境的工具、实施步骤与回退方案。

查阅配套知识
34已发布场景来自公开发布内容
6内容分类全站可用能力分类
53已发布工具用于场景能力编排
34场景更新公开发布与重要变化

场景分类 / 能力领域

全部运维场景

共 34 个结果

从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。

云原生与容器Kubernetes告警治理
工具 4步骤 7240 分钟

以资产证据和备用管理通道为起点,逐项整改账号、SSH、服务和日志策略,并通过灰度与回归验证控制影响。

安全与合规Linux安全加固
工具 3步骤 7270 分钟

围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。

数据库与存储MySQL监控告警
工具 4步骤 7360 分钟

结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。

大数据运维Hadoop大数据
工具 4步骤 7300 分钟

从日志字段、采集位点与缓冲预算到索引生命周期和端到端测试,建设能够衡量延迟、重复与丢失的日志链路。

监控与可观测Elasticsearch日志管理
工具 3步骤 7270 分钟

从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。

数据库与存储Redis监控告警
工具 3步骤 7300 分钟

用 Uptime Kuma 建立独立探测点,验收健康检查、故障通知、状态页和数据目录备份,而不是只确认首页能打开。

监控与可观测Docker告警治理
工具 1步骤 6120 分钟

以 MySQL 单表为试点,核对 CDC 版本、增量快照与日志衔接、Schema 事件及目标提交,通过有限样本与隔离恢复验证同步边界。

大数据运维Apache FlinkApache Flink CDC
工具 3步骤 8180 分钟

关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。

大数据运维Apache Hive大数据
工具 2步骤 8180 分钟

从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。

大数据运维Apache Spark大数据
工具 1步骤 8180 分钟

Latest Updates

最新场景更新

查看全部
  1. 新增站点可用性探测
  2. 新增Flink CDC 快照、结构演进与同步恢复
  3. 新增Iceberg 快照、写入与维护运维
  4. 新增Hive 分区治理与 SQL 执行运维
  5. 新增ClickHouse 合并、副本与查询运维

Scenario Method

方案构成 / 方法论

先明确环境与目标,再结合参考架构理解组件关系,按步骤验证与交接。

关联工具明确所需工具及其能力边界
架构图解理解组件职责、流向与故障域
实施步骤配置可执行的顺序与说明
验证回滚提供验证方式与回滚路径
场景体验按开放状态申请实践环境

DOUYA OPS ECOSYSTEM

体验豆芽自研工具与场景能力

部分场景提供体验环境,用于功能验证、测试和技术交流。