Global Search
搜索整个运维生态
一次检索工具、生态包、场景、知识、项目和文档,直接进入可以执行的答案。
- 知识
Kafka 生产者确认、幂等与事务交付语义
从 acks、ISR、幂等重试与事务提交解释 Kafka 交付边界,用有限事件样本区分记录重复、分区顺序和外部业务副作用。
- 知识
Kafka KRaft 仲裁、元数据日志与控制面巡检
区分 KRaft 投票成员、发现地址与功能级别,通过有限仲裁采样和元数据日志趋势判断控制面健康,明确多数派、节点身份及停止维护的条件。
- 工具
Hadoop
提供 HDFS 分布式存储与 YARN 资源调度的大数据基础平台。
- 知识
Hadoop 小文件治理与数据一致性验收
从文件增长来源、元数据与查询成本选择合并或归档方案,在独立候选目录验证语义、性能和发布回退条件。
- 知识
Hadoop 高可用与恢复演练规划
区分 QJM 日志多数派、自动切换与 fencing,核对恢复输入、隔离演练和新写入后的回切边界。
- 知识
Hadoop 架构基础:HDFS、YARN 与计算链路
理解 HDFS 存储、YARN 调度和计算引擎的责任边界,用有限入口检查与应用时间线建立 Hadoop 集群的架构认识。
- 工具
StarRocks
先辨别 shared-nothing 与 shared-data,再检查 FE、BE 或 CN、导入与主键更新、查询 Profile 和存储恢复边界。
- 工具
ClickHouse
联查 MergeTree parts、查询内存、复制队列和备份恢复,区分本地表、分片与副本,完成有界诊断和隔离验收。
- 知识
Iceberg 表元数据、快照与时间旅行
理解 catalog、metadata、manifest 与文件引用链,用有限元数据查询验证快照关系、时间旅行和历史保留条件。
- 知识
Hive SQL 编译、调度与执行诊断
沿 HiveServer2、Metastore、YARN 与 Tez 解释查询耗时,核对裁剪、统计和 Join 长尾,以固定输入验收优化。
- 知识
Hive Metastore 与分区登记治理
核对 Hive 表类型、分区登记、HMS 持久化与真实目录,区分元数据修复、ACID 维护和数据恢复边界。
- 工具
Apache Hive
关联 Hive Metastore 分区登记、存储位置与 SQL 执行阶段,完成有限取证、候选修复和业务数据验收。
- 场景
Hadoop 集群运维
结合 HDFS 块健康、节点容量与 YARN 队列证据,建立巡检、监控、单节点维护和恢复验收流程。
- 知识
YARN 应用排队与资源瓶颈排查
围绕 Hadoop YARN 应用状态、队列配额、AM 资源和节点可放置性进行故障排查,定位资源空闲却无法调度的原因。
- 知识
HDFS 容量与副本健康巡检
使用 HDFS 报告和指定路径检查,识别 DataNode 容量倾斜、副本不足与文件损坏,记录 Hadoop 集群的日常健康基线。
- 工具
Apache Doris
从 FE 元数据、BE 副本、导入事务与查询 Profile 建立 Doris 分层巡检,验证数据可见性、容量余量与小范围调优效果。
- 知识
Doris 架构、数据模型与乱序更新设计
区分 Doris 存算形态与三类数据模型,核查业务主键、Sequence、分区分桶和重放语义,形成可验收的建模方案。
- 知识
Spark 流任务 checkpoint 与恢复边界
联查输入位点、checkpoint、状态与输出提交,设计有限恢复演练,识别 Kafka 起点、重复写入与状态兼容限制。
- 知识
Spark SQL 执行计划与性能诊断
结合扫描、Join、Shuffle、Task 长尾和 AQE 最终计划定位 SQL 瓶颈,用固定输入验证结果一致性与资源收益。
- 知识
Spark 架构与执行过程:从 Driver 到 Task
通过有限分组样本理解 Driver、Executor、Stage、Shuffle 和 AQE,区分应用排队、计算与输出提交的耗时。