Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 工具
Hadoop
提供 HDFS 分布式存储与 YARN 资源调度的大数据基础平台。
- 知识
Hadoop 架构基础:HDFS、YARN 与计算链路
理解 HDFS 存储、YARN 调度和计算引擎的责任边界,用有限入口检查与应用时间线建立 Hadoop 集群的架构认识。
- 知识
Hadoop 高可用与恢复演练规划
区分 QJM 日志多数派、自动切换与 fencing,核对恢复输入、隔离演练和新写入后的回切边界。
- 知识
Hadoop 小文件治理与数据一致性验收
从文件增长来源、元数据与查询成本选择合并或归档方案,在独立候选目录验证语义、性能和发布回退条件。
- 场景
Hadoop 集群运维
结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。
- 场景
Hadoop DataNode 下线
以 HDFS 正式退役流程迁移 DataNode 副本,核对容量、机架与业务负载后再停止服务并交接资产。
- 知识
HDFS 容量与副本健康巡检
使用 HDFS 报告和指定路径检查,识别 DataNode 容量倾斜、副本不足与文件损坏,记录 Hadoop 集群的日常健康基线。
- 知识
YARN 应用排队与资源瓶颈排查
围绕 Hadoop YARN 应用状态、队列配额、AM 资源和节点可放置性进行故障排查,定位资源空闲却无法调度的原因。
- 知识
HDFS DataNode 下线前后安全核验
为 DataNode 退役检查节点身份、容量与故障域、块恢复和阻塞文件,明确何时可以交付停机以及必须暂停的条件。
- 知识
Hive Metastore 与分区登记治理
核对 Hive 表类型、分区登记、HMS 持久化与真实目录,区分元数据修复、ACID 维护和数据恢复边界。
- 知识
Iceberg 表元数据、快照与时间旅行
理解 catalog、metadata、manifest 与文件引用链,用有限元数据查询验证快照关系、时间旅行和历史保留条件。
- 知识
Spark 流任务 checkpoint 与恢复边界
联查输入位点、checkpoint、状态与输出提交,设计有限恢复演练,识别 Kafka 起点、重复写入与状态兼容限制。
- 知识
Spark SQL 执行计划与性能诊断
结合扫描、Join、Shuffle、Task 长尾和 AQE 最终计划定位 SQL 瓶颈,用固定输入验证结果一致性与资源收益。