知识类型
全部知识
共 22 篇Kubernetes Pod 异常排查手册
从 Pending、CrashLoopBackOff 与探针失败入手,串联事件、容器日志和资源状态,建立 Kubernetes 故障排查的证据链。
MySQL 复制延迟的定位方法
结合复制线程、GTID、事务积压与资源指标分析 MySQL 复制延迟,区分接收异常、回放瓶颈和监控误判。
Uptime Kuma 可用性探测与通知验收
从探测点网络、健康检查规则、通知演练和 data 目录备份出发,验收 Uptime Kuma 是否真能发现故障并安全展示状态页。
StarRocks 物化视图刷新与数据新鲜度
按任务链和分区覆盖解释 StarRocks 异步视图刷新,区分同步调用、透明重写与陈旧容忍,核对维表修订和业务截止点。
Kafka KRaft 仲裁、元数据日志与控制面巡检
区分 KRaft 投票成员、发现地址与功能级别,通过有限仲裁采样和元数据日志趋势判断控制面健康,明确多数派、节点身份及停止维护的条件。
Iceberg Spark 写入与文件维护
区分文件落盘与原子提交,在隔离小表演练数据重写和 orphan 预览,核对业务幂等、保留与恢复边界。
ClickHouse 副本巡检与备份恢复
按本地表和分片巡检复制队列与 Keeper,核对原生备份依赖链,并在隔离目标验证恢复状态与业务样本。
Flink Checkpoint 与故障恢复实践
区分 Checkpoint、Savepoint 与外部事务提交,按阶段定位快照失败,并验收状态、源位置和 Sink 的恢复结果。
Doris 导入事务、发布超时与批次对账
沿 Stream Load 响应、原始 label、事务提交与可见状态核对未知导入结果,区分过滤问题、发布积压和不安全重放。
Spark 流任务 checkpoint 与恢复边界
联查输入位点、checkpoint、状态与输出提交,设计有限恢复演练,识别 Kafka 起点、重复写入与状态兼容限制。
Hadoop 高可用与恢复演练规划
区分 QJM 日志多数派、自动切换与 fencing,核对恢复输入、隔离演练和新写入后的回切边界。
GitLab 恢复完整性检查清单
从备份范围、配置密钥与对象存储出发,核对同版本隔离恢复、仓库和权限样本,区分任务成功、数据完整性与正式切流。
Topic Collections
知识专题导航
Knowledge FAQ
常见问题 FAQ
如何找到适合当前问题的知识文章?
可先使用关键词搜索,再结合文章类型、分类、标签与难度缩小范围;筛选条件会保留在网址中,便于分享和再次访问。
文章中的操作步骤可以直接用于生产环境吗?
知识内容用于经验复用与方案参考。生产操作前仍应结合自身环境完成评审、备份、验证与回滚准备。
知识内容如何保持更新?
后台发布或更新文章后,公开列表、正文和知识更新记录会同步;归档内容不再出现在公开列表中。内置文章的导读、图解和判读补充随前端版本维护,调整正文时也需复核这些关联内容。
导读和架构图是否代表已经完成验证?
不代表。导读帮助理解原理,关联图解说明参考组件和连接关系;每篇会注明图解的适用范围。请以文章的验证说明为准,并在当前环境重新核对版本、权限、证据和回退边界。
如何参与知识内容建设?
具备内容权限的成员可从内容管理入口创建草稿,补充正文、标签和工具或场景关系,审核发布后即可公开检索。