Operations Playbooks

运维场景中心

从问题定位到恢复验收,查找适合当前环境的工具、实施步骤与回退方案。

查阅配套知识
34已发布场景来自公开发布内容
6内容分类全站可用能力分类
53已发布工具用于场景能力编排
34场景更新公开发布与重要变化

场景分类 / 能力领域

全部运维场景

共 10 个结果
当前条件:标签 高可用清除全部

围绕 GTID 复制、旧主隔离、代理入口和受控切换,建立有一致性检查与恢复边界的 MySQL 高可用流程。

数据库与存储MySQL监控告警
工具 4步骤 7360 分钟

从主从数据基线、Sentinel 多数授权到客户端发现和故障演练,明确异步复制与新主接写后的恢复边界。

数据库与存储Redis监控告警
工具 3步骤 7300 分钟

核对 GitLab 数据、配置、密钥与对象存储备份,在同版本隔离实例验证仓库、权限和附件,建立可审阅的恢复证据。

自动化与交付CI/CD安全加固
工具 1步骤 8240 分钟

区分 maxmemory、进程 RSS、复制与 AOF 缓冲,结合有界采样、慢日志和业务指标定位 Redis 内存压力及延迟。

数据库与存储Redis监控告警
工具 3步骤 890 分钟

在隔离空实例中核验完整基础备份、连续 WAL 与时间线,按明确时区暂停至目标点,完成数据抽样和恢复证据交接。

数据库与存储PostgreSQL监控告警
工具 3步骤 8180 分钟

以 etcd 3.6 工具链验证快照可恢复性,覆盖完整性、隔离新集群、revision 边界、客户端验收和回退停止点。

云原生与容器Kubernetes监控告警
工具 3步骤 8180 分钟

围绕 Kafka broker、KRaft 控制面与消费积压搭建受限指标采集,形成分级告警和可复核的业务基线。

监控与可观测Kafka告警治理
工具 4步骤 7150 分钟

以 HDFS 正式退役流程迁移 DataNode 副本,核对容量、机架与业务负载后再停止服务并交接资产。

大数据运维HadoopLinux
工具 3步骤 7180 分钟

用 Patroni、etcd 与 HAProxy 建立 PostgreSQL 单主访问链路,明确复制一致性、旧主隔离和恢复验收。

数据库与存储LinuxPostgreSQL
工具 4步骤 7240 分钟

Latest Updates

最新场景更新

查看全部
  1. 新增站点可用性探测
  2. 新增Flink CDC 快照、结构演进与同步恢复
  3. 新增Iceberg 快照、写入与维护运维
  4. 新增Hive 分区治理与 SQL 执行运维
  5. 新增ClickHouse 合并、副本与查询运维

Scenario Method

方案构成 / 方法论

先明确环境与目标,再结合参考架构理解组件关系,按步骤验证与交接。

关联工具明确所需工具及其能力边界
架构图解理解组件职责、流向与故障域
实施步骤配置可执行的顺序与说明
验证回滚提供验证方式与回滚路径
场景体验按开放状态申请实践环境

DOUYA OPS ECOSYSTEM

体验豆芽自研工具与场景能力

部分场景提供体验环境,用于功能验证、测试和技术交流。