编排平台:Kubernetes 工作负载与集群恢复

覆盖命名空间接入、调度故障、发布观察窗,以及 etcd 状态与业务卷的独立备份。

Kubernetes高可用

编排平台:Kubernetes 发布与恢复

职责边界

图中 k8s 对应 Kubernetes 工作负载编排。它承接声明式部署、调度和服务发现,但应用状态、数据库事务、镜像来源和业务可用性仍需对应团队负责。本方案不预设所有平台组件都必须部署进 Kubernetes,也不承诺建成高可用集群。

本手册只给出接入及运维设计,没有对真实集群执行命令。命名空间、角色、网络策略、部署和故障演练均待目标环境授权,实施前必须再次确认所用上下文与目标环境。

前提依赖与最小权限

登记集群版本、安装形态、控制平面责任、容器运行时、网络插件、存储类、入口和证书管理方式。确认平台组件的数据库或持久卷是否支持当前部署模式,不能将单机数据目录挂到共享卷就视作高可用。

按团队划分命名空间、配额与服务账号,Jenkins 发布账号仅能操作约定资源。不要把集群管理员 kubeconfig 分发给构建任务;读取 Secret、创建高权限工作负载或修改角色都可能扩大权限,需单独评审。Kubernetes RBAC 实践

工作负载接入流程

先验证一个无状态测试服务,确认镜像按摘要拉取、资源请求与限制、健康探针、退出行为以及日志字段。网络策略是否真正生效取决于实际网络实现,需用允许与拒绝流量用例验证。服务发现和入口路由单独验收,不能只看 Pod 为 Running。

发布前记录旧工作负载配置、新制品摘要、变更工单、观察窗和回退依据。应用涉及持久数据时,先验证卷访问模式、调度约束和数据恢复办法,再讨论副本数。滚动发布或节点维护也必须符合业务允许的中断预算,未经评估不驱逐有状态负载。

日常巡检与发布观察

检查 API 可用性、节点条件、未调度工作负载、异常重启、资源压力、卷挂载、DNS 和入口错误。用工作负载期望副本与可用副本差异辅助判断,结合业务探测和延迟变化,避免把就绪状态当作完整业务成功。

每次发布比较实际运行摘要与批准摘要,确认日志和监控携带正确发布标识。定期核对证书期限、集群版本支持情况、配额增长和备份新鲜度;安全升级需要维护窗口与回退评审,不在日常巡检中直接滚动更新控制平面。

故障分支

Pending 先看事件,按资源不足、调度约束、污点和卷绑定分支排查;镜像拉取失败核对仓库可达性、证书、摘要和拉取身份。反复退出则看容器退出原因、此前日志和探针配置,不能通过删除探针掩盖启动问题。官方 Pod 排查指南

Pod 就绪而外部访问失败时依次核对 Service 选择器、端点、DNS、网络策略及入口。单节点异常与控制平面异常分开处理,禁止在状态不明时批量删除 Pod、PVC 或解除保护机制来加速恢复。

安全与备份恢复

etcd 保存 Kubernetes 对象状态,快照含有敏感信息,应加密并验证;恢复工具和兼容性需匹配实际 etcd 版本。官方 etcd 运维说明

etcd 快照不会替代业务持久卷内容、外部数据库或镜像仓库备份。本方案要求分别建立控制面状态、应用配置、密钥、业务数据与制品的恢复清单。演练先在隔离环境恢复依赖,再恢复应用并核对业务数据一致性;回退 Deployment 只改变工作负载声明,不撤销已写入的数据。

验收与停止点

证明发布账号不能跨命名空间操作、拒绝网络用例有效、指定摘要可运行、发布失败能停止并可回到兼容制品。至少记录一次业务数据恢复及一次集群对象恢复的独立结果。目标上下文不明、可回退制品丢失、数据恢复未验证或控制平面不健康时,停止发布与批量维护。

官方参考

实际集群应使用与版本对应的官方文档;本方案不固定安装版本或插件组合。可继续对照Kubernetes 监控场景Harbor 手册验证观测与制品依赖。

DOUYA OPS ECOSYSTEM

完善文档,帮助更多运维人

把安装、配置、API 与运维方法沉淀为清晰文档,让工具和项目更容易被正确使用。