解决AWS Deep Learning AMI (Ubantu) 中的GPU不可用问题

2024-01-01 20:48

本文主要是介绍解决AWS Deep Learning AMI (Ubantu) 中的GPU不可用问题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

作者:光环云 田帆

在AWS众多官方AMI中有一个比较特殊的版本就是适用于机器学习的操作系统Deep Learning AMI, 它内部预先集成了很多机器学习的框架,比如TensorFlow, Mxnet等。如下图展示为中国区的Deep Learning AMI Ubantu。
在这里插入图片描述
此系统为了方便客户进行机器学习,免除了安装所需框架的步骤。方便客户去直接进行机器学的操作。让客户能够把精力都聚焦在业务上。结合AWS提供的GPU实例,能够省去客户在机器学习前的安装、部署、搭建框架的繁复操作。但是,根据AWS官方的推荐,此系统更加适合于一次性机器学习任务。换句话说,如果您已经准备好大量的数据源,准备临时或者批次性的跑机器学习的任务,这个系统搭配GPU的实例可是实现快速的开始执行机器学习任务。下图为正常情况下Deep Learning AMI中预装的机器学习环境。
在这里插入图片描述
您可以选择您需要的环境,然后输入后面相应的命令之后就可以进入环境。非常简单方便。
不过,在客户的实际生产应用中会遇到一些问题,我们需要特别注意。由于AWS 的AMI都是由AWS后台来进行维护的,所以在重启或者停机之后再启动实例时,有可能会遇到使用此AMI的实例无法加载GPU的情况。正常情况当选择好环境后会看到GPU相关的信息,如下图:
在这里插入图片描述
当我们遇到下列错误提示时,说明此实例的GPU显卡没有加载成功:

ubuntu@ip-172-31-17-216:~$ nvidia-smi 
NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver. Make sure that the latest NVIDIA driver is installed and running.

错误提示表示为GPU的驱动没有加载。那么是什么原因造成的这种情况呢?Amazon Deep Learning AMI 是由AWS后台来进行维护,为了众多的环境兼容和稳定,当实例重启或者停止之后会更新系统的内核版本。而中国区此AMI自带的GPU驱动版本比较老,所以在内核更新之后会无法识别老的GPU驱动,造成GPU显卡无法加载。
那么解决此问题只需要手动的更新GPU驱动即可。下面介绍更新驱动的步骤。
我们可以写一个更新GPU版本驱动的脚本:
#!/bin/bash

set -xversion=$1
#version=410.79
#version=410.104wget http://us.download.nvidia.com/tesla/${version}/NVIDIA-Linux-x86_64-${version}.run 
sudo sh ./NVIDIA-Linux-x86_64-${version}.run --no-drm --disable-nouveau --dkms --silent --install-libglvnd 

此脚本中我们会从NVIDIA官网下载不同版本的驱动并进行安装。在执行时后面带上需要的GPU版本为脚本传参。

$ sudo ./install.sh 410.104

之后查看更新后的显卡模块版本:

$ modinfo nvidia | head -7
filename: /lib/modules/4.4.0-1077-aws/updates/dkms/nvidia.ko
alias: char-major-195-*
version: 410.104
supported: external
license: NVIDIA
srcversion: 3B812B02678A6B43A294F17
alias: pci:v000010DEd00000E00sv*sd*bc04sc80i00*

加载显卡模块:

$ sudo modprobe nvidia

启动GPU,查看是否已经正常工作:

$ nvidia-smi

至此,我们的实例应该已经可以正常使用GPU显卡了,但是前提是保证在内核不更新的情况下,可以正常加载GPU。如果在内核更新而且GPU的驱动再次过老之后依然会出现这个现象。所以,如果想一劳永逸的避免这种情况,只能手动关闭系统内核的更新机制来解决。不过,由于此AMI的初衷是提供给客户方便灵活的进行一次性机器任务的,所以不推荐客户长时间利用此AMI进行生产的部署,如果需要请自行搭建机器学习平台或者模型运行的环境。
此外,在AWS global 区域已经推出最新的Deep Learning (Ubantu) 23.0版本(如下图),不会出现类似问题。
在这里插入图片描述


光环云数据有限公司(简称“光环云”)是由光环新网科技股份有限公司与管理团队于2018年5月联合发起设立。光环新网获得亚马逊通授权,独立运营AWS中国(北京)区域云服务。
作为光环新网附属企业,光环云专注于AWS云服务在中国的市场推广与销售、完善和提升网络交付与服务能力、丰富AWS云服务应用市场,为中国企业全面实现云转型升级、供给侧改革和双创事业提供下一代IT基础设施。
在这里插入图片描述

这篇关于解决AWS Deep Learning AMI (Ubantu) 中的GPU不可用问题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/560472

相关文章

SQL Server配置管理器无法打开的四种解决方法

《SQLServer配置管理器无法打开的四种解决方法》本文总结了SQLServer配置管理器无法打开的四种解决方法,文中通过图文示例介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的... 目录方法一:桌面图标进入方法二:运行窗口进入检查版本号对照表php方法三:查找文件路径方法四:检查 S

怎样通过分析GC日志来定位Java进程的内存问题

《怎样通过分析GC日志来定位Java进程的内存问题》:本文主要介绍怎样通过分析GC日志来定位Java进程的内存问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、GC 日志基础配置1. 启用详细 GC 日志2. 不同收集器的日志格式二、关键指标与分析维度1.

Java 线程安全与 volatile与单例模式问题及解决方案

《Java线程安全与volatile与单例模式问题及解决方案》文章主要讲解线程安全问题的五个成因(调度随机、变量修改、非原子操作、内存可见性、指令重排序)及解决方案,强调使用volatile关键字... 目录什么是线程安全线程安全问题的产生与解决方案线程的调度是随机的多个线程对同一个变量进行修改线程的修改操

Redis出现中文乱码的问题及解决

《Redis出现中文乱码的问题及解决》:本文主要介绍Redis出现中文乱码的问题及解决,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1. 问题的产生2China编程. 问题的解决redihttp://www.chinasem.cns数据进制问题的解决中文乱码问题解决总结

全面解析MySQL索引长度限制问题与解决方案

《全面解析MySQL索引长度限制问题与解决方案》MySQL对索引长度设限是为了保持高效的数据检索性能,这个限制不是MySQL的缺陷,而是数据库设计中的权衡结果,下面我们就来看看如何解决这一问题吧... 目录引言:为什么会有索引键长度问题?一、问题根源深度解析mysql索引长度限制原理实际场景示例二、五大解决

Springboot如何正确使用AOP问题

《Springboot如何正确使用AOP问题》:本文主要介绍Springboot如何正确使用AOP问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录​一、AOP概念二、切点表达式​execution表达式案例三、AOP通知四、springboot中使用AOP导出

Python中Tensorflow无法调用GPU问题的解决方法

《Python中Tensorflow无法调用GPU问题的解决方法》文章详解如何解决TensorFlow在Windows无法识别GPU的问题,需降级至2.10版本,安装匹配CUDA11.2和cuDNN... 当用以下代码查看GPU数量时,gpuspython返回的是一个空列表,说明tensorflow没有找到

解决未解析的依赖项:‘net.sf.json-lib:json-lib:jar:2.4‘问题

《解决未解析的依赖项:‘net.sf.json-lib:json-lib:jar:2.4‘问题》:本文主要介绍解决未解析的依赖项:‘net.sf.json-lib:json-lib:jar:2.4... 目录未解析的依赖项:‘net.sf.json-lib:json-lib:jar:2.4‘打开pom.XM

XML重复查询一条Sql语句的解决方法

《XML重复查询一条Sql语句的解决方法》文章分析了XML重复查询与日志失效问题,指出因DTO缺少@Data注解导致日志无法格式化、空指针风险及参数穿透,进而引发性能灾难,解决方案为在Controll... 目录一、核心问题:从SQL重复执行到日志失效二、根因剖析:DTO断裂引发的级联故障三、解决方案:修复

IDEA Maven提示:未解析的依赖项的问题及解决

《IDEAMaven提示:未解析的依赖项的问题及解决》:本文主要介绍IDEAMaven提示:未解析的依赖项的问题及解决,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝... 目录IDEA Maven提示:未解析的依编程赖项例如总结IDEA Maven提示:未解析的依赖项例如