本文主要是介绍记一次生产环境cdh6.3.2集群yarn组件nodemanager节点down掉的事故分析,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
有关2023.10.2日发现的yarn部分nodeManager组件节点不可用的原因分析
- yarn组件异常情况始于2023.09.30日06时00分,恢复于2023.10.02日10点35分。
- 每日凌晨6点,大数据定时任务:task1启动,该任务持续时长1小时20~25分钟左右,是mapreduce引擎类型任务,会使用大量cpu资源。
- 赶上国庆节假日出行,遇到数据处理波峰,从大行程统计看,大行程从10.29日开始行程数据处理量处于波峰阶段。各实时任务和离线任务数据处理赶上资源(内存和CPU)使用高峰期。如nodemanager组件在work01节点down掉的时候,内存利用率为83.15%。
- 从down掉的节点上日志打印
“早上6点14:56.982分 INFO ContainersMonitorImpl Skipping monitoring container container_e36_1691568999943_5019_01_000003 since CPU usage is not yet available.
早上6点14:57.003分 INFO ContainersMonitorImpl Skipping monitoring container container_e36_1691568999943_5019_01_000002 since CPU usage is not yet available.”
来看,也体现出无CPU资源可用的现象,这是2023.09.30日06:14分打印出来的日志信息,契合nodemanager组件节点down掉的时间信息。
- 综上所述,目前得出结论,10月2日的组件down掉现象,与资源紧张成强相关关系。
- 当前解决办法:
1) 调优集群参数,拓展出8G的集群内存资源;增加yarn任务调度的均衡性,更加合理运行各工作节点的内存资源。
2)调优相关定时任务内存启动参数 。
3)国庆假期已结束,继续持续观察一周集群任务运行状态。
这篇关于记一次生产环境cdh6.3.2集群yarn组件nodemanager节点down掉的事故分析的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!