开源工具 · 大数据运维

Apache Spark

从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。

Apache Spark大数据

Overview

定位与架构

采用 Spark 3.5.7 的批处理与 Structured Streaming 微批模式。YARN、Kubernetes 和 Standalone 的资源管理不同,部署平台状态与 Spark 作业状态需分别检查。

运维重点

准备 Application ID、attempt、制品和提交参数、event log 与 History Server 权限,记录数据快照和输出路径。REST 示例要求 SPARK_HISTORY_URL 指向已认证的只读 HTTPS 网关,SPARK_APP_ID 为具体应用;多 attempt 应在 API 路径追加已确认 attempt。

使用边界

不通过反复重提作业、清空 checkpoint、全量 collect 或扩大 Driver 内存代替诊断。批任务重跑与流式恢复必须考虑已提交输出和外部副作用。

本站按 L1 资料收录,未提供在线体验;文档和参考图不代表已部署或经过环境验证。

配套知识

官方资料

DOUYA OPS ECOSYSTEM

探索豆芽自研工具

查阅工具能力、使用方法与实践文档;体验是否开放,以各工具页面的状态为准。