记一次生产环境cdh6.3.2集群yarn组件nodemanager节点down掉的事故分析

本文主要是介绍记一次生产环境cdh6.3.2集群yarn组件nodemanager节点down掉的事故分析，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

有关2023.10.2日发现的yarn部分nodeManager组件节点不可用的原因分析

yarn组件异常情况始于2023.09.30日06时00分，恢复于2023.10.02日10点35分。
每日凌晨6点，大数据定时任务：task1启动，该任务持续时长1小时20~25分钟左右，是mapreduce引擎类型任务，会使用大量cpu资源。
赶上国庆节假日出行，遇到数据处理波峰，从大行程统计看，大行程从10.29日开始行程数据处理量处于波峰阶段。各实时任务和离线任务数据处理赶上资源（内存和CPU）使用高峰期。如nodemanager组件在work01节点down掉的时候，内存利用率为83.15%。
从down掉的节点上日志打印

“早上6点14:56.982分  INFO ContainersMonitorImpl Skipping monitoring container container_e36_1691568999943_5019_01_000003 since CPU usage is not yet available. 
早上6点14:57.003分 INFO ContainersMonitorImpl  Skipping monitoring container container_e36_1691568999943_5019_01_000002 since CPU usage is not yet available.”

来看，也体现出无CPU资源可用的现象，这是2023.09.30日06:14分打印出来的日志信息，契合nodemanager组件节点down掉的时间信息。