Operations Playbooks

运维场景中心

从问题定位到恢复验收,查找适合当前环境的工具、实施步骤与回退方案。

查阅配套知识
34已发布场景来自公开发布内容
6内容分类全站可用能力分类
53已发布工具用于场景能力编排
34场景更新公开发布与重要变化

场景分类 / 能力领域

全部运维场景

共 12 个结果
当前条件:难度 进阶清除全部

从对象清单、指标覆盖和资源预算开始,打通采集、看板、分级告警、故障演练及值班交接。

云原生与容器Kubernetes告警治理
工具 4步骤 7240 分钟

以资产证据和备用管理通道为起点,逐项整改账号、SSH、服务和日志策略,并通过灰度与回归验证控制影响。

安全与合规Linux安全加固
工具 3步骤 7270 分钟

从日志字段、采集位点与缓冲预算到索引生命周期和端到端测试,建设能够衡量延迟、重复与丢失的日志链路。

监控与可观测Elasticsearch日志管理
工具 3步骤 7270 分钟

区分 maxmemory、进程 RSS、复制与 AOF 缓冲,结合有界采样、慢日志和业务指标定位 Redis 内存压力及延迟。

数据库与存储Redis监控告警
工具 3步骤 890 分钟

为临时远程运维通过 JumpServer 与 OpenSSH 提供限定资产、账号和时段的远程终端,并验证到期后新连接与已有会话均被回收。

安全与合规Linux临时远程访问
工具 2步骤 760 分钟

围绕 Kafka broker、KRaft 控制面与消费积压搭建受限指标采集,形成分级告警和可复核的业务基线。

监控与可观测Kafka告警治理
工具 4步骤 7150 分钟

建立镜像来源、摘要、扫描、仓库访问和保留规则,验证制品可拉取、可恢复且清理范围可解释。

云原生与容器CI/CDDocker
工具 3步骤 7240 分钟

以受控资产清单、声明式配置和小批执行建立 Linux 主机基线,验证幂等性、访问保留与失败回退。

自动化与交付AnsibleLinux
工具 2步骤 7240 分钟

围绕容器日志发现、元数据补充、断点与缓冲治理,建立可检索、可隔离且可回退的集群日志链路。

云原生与容器ElasticsearchKubernetes
工具 4步骤 7240 分钟

从主机清单和指标基线出发,建立 CPU、内存、磁盘、网络与采集链路的可验证监控闭环。

监控与可观测LinuxPrometheus
工具 4步骤 7180 分钟

Latest Updates

最新场景更新

查看全部
  1. 新增站点可用性探测
  2. 新增Flink CDC 快照、结构演进与同步恢复
  3. 新增Iceberg 快照、写入与维护运维
  4. 新增Hive 分区治理与 SQL 执行运维
  5. 新增ClickHouse 合并、副本与查询运维

Scenario Method

方案构成 / 方法论

先明确环境与目标,再结合参考架构理解组件关系,按步骤验证与交接。

关联工具明确所需工具及其能力边界
架构图解理解组件职责、流向与故障域
实施步骤配置可执行的顺序与说明
验证回滚提供验证方式与回滚路径
场景体验按开放状态申请实践环境

DOUYA OPS ECOSYSTEM

体验豆芽自研工具与场景能力

部分场景提供体验环境,用于功能验证、测试和技术交流。