13.3 Spark调优-JVM调优,shuffle调优, Reduce OOM

2024-06-07 19:08

本文主要是介绍13.3 Spark调优-JVM调优,shuffle调优, Reduce OOM,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

JVM调优:

Executor JVM堆内存 分为三块 静态资源划分

(60%(RDD以及广播变量存储的位置)+20%(运行内存)+20%(reduce 聚合内存))*90%+10%(JVM自身预留) = JVM堆内存

JVM的gc回收流程(属于运行内存中):

在task中创建出来的对象首先往eden和survior1种存放,survior2是空闲的。当eden和survior1区域放满以后就会触发minor gc(小型垃圾回收),清理掉不再使用的对象(死亡)。

会将存活下来的对象放入survior2中,如果存活下来的对象大于survior2的大小,那么JVM就会通过担保机制将多余的对象直接放入到老年代中。

如果这个时候年轻代的内存不是很大的话就会经常的进行minor gc(小型垃圾回收),频繁的minor gc会导致这段时间内有些存活的对象(多次垃圾回收都没有回收掉,一直在用又不能被释放)频繁的倒来倒去,会导致这些短生命周期的对象(不一定长期使用)每进行一次垃圾回收就会长一岁,年龄过大默认15岁,垃圾回收还是没有回收回去的就会跑到老年代里面去。

就会导致老年代中存放大量的短生命周期的对象,老年代应该存放的是数量比较少并且长期使用的对象,比如数据库连接池。这样的话,老年代就会溢满,触发full gc,因为本来老年代中的对象很少,很少进行full gc因此采取了不太复杂但消耗性能和时间的垃圾回收算法。

不管minor gc还是full gc都会导致JVM的工作线程停止

 

总结:堆内内存不足造成的影响

1,频繁的minor gc

2,老年代大量的短生命周期的对象会导致full gc

3,有了gc 就会影响Spark的性能和运行速度

增加内存或者提高运行内存比例解决频繁gc

还有一种方案:

统一的内存管理:JVM堆内存-300M

运行内存 占剩余内存的50%

存储内存 占剩余内存的50%

运行内存和存储内存可互相借用


Shuffle的调优

1、buffer的大小 32k

2、reduce task拉数据 3s 5次

3、hashShuffle 合并机制

4、每次拉取的数据量

5、reduce 聚合的内存比例

6、bypass 机制

7、spark.shuffle.manager sort 选用哪种shuffle

shuffle file connot find(磁盘小文件找不到的原因)?

Executor挂掉:

堆内内不足 --executor-memory 10G

堆外内存不足 shuffle有数据传输,netty 内部封装的是java NIO,是零拷贝,拷贝到堆外内存中

默认是这个Executor内存的10%

2G * 10% = 200M

如何调整堆外内存?

yarn:

--conf spark.yarn.executor.memoryOverhead=2048

standalone:

--conf spark.executor.memoryOverhead=2048

注意事项:

spark-submit脚本里面,去用--conf的方式,去添加配置

Executor没有挂掉:

建立通信失败:

如何提高建立通信的等待时间

--conf spark.core.connection.ack.wait.timeout=60s

注意事项:

spark-submit脚本里面,去用--conf的方式,去添加配置

数据传输的过程

暂时不知道


reduce oom问题

1,map端的map task计算完成后会将task计算的结果根据分区器的策略写入到磁盘小文件中

2,reduce端聚合的时候,会产生5个拉取数据的子线程,每次总共拉取48M的数据,reduce task来执行计算这些数据,默认reduce task端占20%的执行内存,当执行速度小于拉取速度时就会产生reduce oom

 

解决办法:

1,每次拉取数据从48M减少至24M

2,增加worker中的内存或者聚合比例 spark.shuffle.memoryFraction

这篇关于13.3 Spark调优-JVM调优,shuffle调优, Reduce OOM的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1040037

相关文章

JVM 的类初始化机制

前言 当你在 Java 程序中new对象时,有没有考虑过 JVM 是如何把静态的字节码(byte code)转化为运行时对象的呢,这个问题看似简单,但清楚的同学相信也不会太多,这篇文章首先介绍 JVM 类初始化的机制,然后给出几个易出错的实例来分析,帮助大家更好理解这个知识点。 JVM 将字节码转化为运行时对象分为三个阶段,分别是:loading 、Linking、initialization

Spring Security 基于表达式的权限控制

前言 spring security 3.0已经可以使用spring el表达式来控制授权,允许在表达式中使用复杂的布尔逻辑来控制访问的权限。 常见的表达式 Spring Security可用表达式对象的基类是SecurityExpressionRoot。 表达式描述hasRole([role])用户拥有制定的角色时返回true (Spring security默认会带有ROLE_前缀),去

浅析Spring Security认证过程

类图 为了方便理解Spring Security认证流程,特意画了如下的类图,包含相关的核心认证类 概述 核心验证器 AuthenticationManager 该对象提供了认证方法的入口,接收一个Authentiaton对象作为参数; public interface AuthenticationManager {Authentication authenticate(Authenti

Spring Security--Architecture Overview

1 核心组件 这一节主要介绍一些在Spring Security中常见且核心的Java类,它们之间的依赖,构建起了整个框架。想要理解整个架构,最起码得对这些类眼熟。 1.1 SecurityContextHolder SecurityContextHolder用于存储安全上下文(security context)的信息。当前操作的用户是谁,该用户是否已经被认证,他拥有哪些角色权限…这些都被保

Spring Security基于数据库验证流程详解

Spring Security 校验流程图 相关解释说明(认真看哦) AbstractAuthenticationProcessingFilter 抽象类 /*** 调用 #requiresAuthentication(HttpServletRequest, HttpServletResponse) 决定是否需要进行验证操作。* 如果需要验证,则会调用 #attemptAuthentica

Spring Security 从入门到进阶系列教程

Spring Security 入门系列 《保护 Web 应用的安全》 《Spring-Security-入门(一):登录与退出》 《Spring-Security-入门(二):基于数据库验证》 《Spring-Security-入门(三):密码加密》 《Spring-Security-入门(四):自定义-Filter》 《Spring-Security-入门(五):在 Sprin

Java架构师知识体认识

源码分析 常用设计模式 Proxy代理模式Factory工厂模式Singleton单例模式Delegate委派模式Strategy策略模式Prototype原型模式Template模板模式 Spring5 beans 接口实例化代理Bean操作 Context Ioc容器设计原理及高级特性Aop设计原理Factorybean与Beanfactory Transaction 声明式事物

Hadoop企业开发案例调优场景

需求 (1)需求:从1G数据中,统计每个单词出现次数。服务器3台,每台配置4G内存,4核CPU,4线程。 (2)需求分析: 1G / 128m = 8个MapTask;1个ReduceTask;1个mrAppMaster 平均每个节点运行10个 / 3台 ≈ 3个任务(4    3    3) HDFS参数调优 (1)修改:hadoop-env.sh export HDFS_NAMENOD

Java进阶13讲__第12讲_1/2

多线程、线程池 1.  线程概念 1.1  什么是线程 1.2  线程的好处 2.   创建线程的三种方式 注意事项 2.1  继承Thread类 2.1.1 认识  2.1.2  编码实现  package cn.hdc.oop10.Thread;import org.slf4j.Logger;import org.slf4j.LoggerFactory

JAVA智听未来一站式有声阅读平台听书系统小程序源码

智听未来,一站式有声阅读平台听书系统 🌟 开篇:遇见未来,从“智听”开始 在这个快节奏的时代,你是否渴望在忙碌的间隙,找到一片属于自己的宁静角落?是否梦想着能随时随地,沉浸在知识的海洋,或是故事的奇幻世界里?今天,就让我带你一起探索“智听未来”——这一站式有声阅读平台听书系统,它正悄悄改变着我们的阅读方式,让未来触手可及! 📚 第一站:海量资源,应有尽有 走进“智听