开源工具 · 大数据运维
Apache Spark
从 Driver、Executor、Stage 与 SQL 计划定位 Spark 作业瓶颈,结合事件日志和 checkpoint 核验批处理与流式恢复边界。
Overview
定位与架构
采用 Spark 3.5.7 的批处理与 Structured Streaming 微批模式。YARN、Kubernetes 和 Standalone 的资源管理不同,部署平台状态与 Spark 作业状态需分别检查。
运维重点
准备 Application ID、attempt、制品和提交参数、event log 与 History Server 权限,记录数据快照和输出路径。REST 示例要求 SPARK_HISTORY_URL 指向已认证的只读 HTTPS 网关,SPARK_APP_ID 为具体应用;多 attempt 应在 API 路径追加已确认 attempt。
使用边界
不通过反复重提作业、清空 checkpoint、全量 collect 或扩大 Driver 内存代替诊断。批任务重跑与流式恢复必须考虑已提交输出和外部副作用。
本站按 L1 资料收录,未提供在线体验;文档和参考图不代表已部署或经过环境验证。