Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 知识
Kubernetes Pod 异常排查手册
从 Pending、CrashLoopBackOff 与探针失败入手,串联事件、容器日志和资源状态,建立 Kubernetes 故障排查的证据链。
- 知识
Kubernetes DNS 与 Service 分层排障手册
区分域名解析、Service 端点、后端应用与节点数据面问题,明确只读证据、获准探测、最小变更和访问隔离验收。
- 知识
Kubernetes 日志丢失与重复的定位流程
沿应用、容器日志、Fluent Bit 与存储查询四层核对同一事件,区分轮转丢失、缓冲积压、重复采集和检索条件错误。
- 知识
统一身份接入、权限复核与离职回收
区分 LDAP 目录与应用授权,串联 GitLab、JumpServer 和 Kubernetes 的正反向验收、令牌会话清点与离职回收证据。
- 知识
etcd 快照与隔离恢复验证手册
以 etcd 3.6 核对快照完整性、新逻辑集群隔离、revision 与 watch 缓存边界,分阶段证明文件、服务和客户端可恢复性。
- 知识
从提交到部署:跨组件发布证据链
连接 GitLab 提交、Jenkins 构建、Nexus 制品、Harbor 镜像与 Kubernetes 部署,核对摘要、门禁和业务验收,区分应用回退与数据恢复。
- 知识
CI/CD 发布失败的分层定位与证据交接
沿源码、执行节点、测试、镜像与部署状态定位 CI/CD 首个失败阶段,区分门禁拒绝和基础设施异常,明确重试、暂停与状态恢复边界。
- 知识
Spark 架构与执行过程:从 Driver 到 Task
通过有限分组样本理解 Driver、Executor、Stage、Shuffle 和 AQE,区分应用排队、计算与输出提交的耗时。
- 知识
Prometheus 告警分级与降噪实践
以业务影响定义 Prometheus 告警级别,配置 Alertmanager 分组、抑制和静默,并验证通知、恢复与值班响应。
- 知识
10 亿数据如何快速插入 MySQL
优先考虑批量文件导入而非多线程 INSERT,从数据预处理与分片、保留主键延后二级索引、LOAD DATA 或 MySQL Shell 并行导入,到分片校验、后建索引和硬件选型,给出 10 亿行级 InnoDB 导入的落地方案与失败恢复设计。
- 知识
Harbor 保留规则与 GC 安全检查
核对运行与回退镜像摘要,区分保留规则、不可变策略和垃圾回收,以双重预演、独立审批和冷拉取防止误删。