Nvidia显卡Failed to initialize NVML Driver/library version mismatch错误解决方案

本文主要是介绍Nvidia显卡Failed to initialize NVML Driver/library version mismatch错误解决方案,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

最近GPT比较火,开始折腾了一下gpu,用来跑项目:
https://github.com/OpenTalker/SadTalker
今天运行程序突然发现用不了,经排查应该是由于NVIDIA内核驱动版本与系统驱动版本不一致导致的。

下面简单总结了这个错误的解决方案。

问题复现

在这里插入图片描述
查看系统驱动日志
cat /var/log/dpkg.log | grep nvidia
在这里插入图片描述## 问题原因分析
NVIDIA内核驱动版本与系统驱动版本不匹配。
##查看显卡驱动内核版本
cat /proc/driver/nvidia/version
NVRM version: NVIDIA UNIX x86_64 Kernel Module 470.223.02 Thu May 11 11:46:56 UTC 2023
GCC version: gcc version 11.4.0 (Ubuntu 11.4.0-1ubuntu1~22.04)
查看已安装驱动程序

dpkg --list | grep nvidia-*
在这里插入图片描述
经排查英伟达显卡驱动自动更新了,导致程序运行失败。

下面是版本回退操作,
解决方案
卸载现有驱动,重新安装
sudo /usr/bin/nvidia-uninstall
sudo apt-get --purge remove nvidia-*
sudo apt-get purge nvidia*
sudo apt-get purge libnvidia*
直到命令不输出任何内容
sudo dpkg --list | grep nvidia-*重新安装
sudo chmod a+x NVIDIA-Linux-x86_64-470.199.02.run
sudo ./NVIDIA-Linux-x86_64-470.199.02.run -no-x-check -no-nouveau-check -no-opengl-files–no-opengl-files 只安装驱动文件,不安装OpenGL文件–no-x-check 安装驱动时不检查X服务–no-nouveau-check 安装驱动时不检查nouveau

报错处理:
一,
在这里插入图片描述

1.下载官方驱动程序
清除之前残留的nvidia驱动

apt-get remove --purge nvidia*

  1. 禁止集成的nouveau驱动

Ubuntu系统集成的显卡驱动程序是nouveau,它是第三方为NVIDIA开发的开源驱动,我们需要先将其屏蔽才能安装NVIDIA官方驱动。
将驱动添加到黑名单blacklist.conf中,但是由于该文件的属性不允许修改。所以需要先修改文件属性。

创建文件:
cat /etc/modprobe.d/blacklist-nouveau.conf
blacklist nouveau
blacklist lbm-nouveau
options nouveau modeset=0
alias nouveau off
alias lbm-nouveau off
options nouveau modeset=0
blacklist rivafb
blacklist vga16fb
blacklist nouveau
blacklist nvidiafb
blacklist rivatv

卸载之前安装的残留文件
sudo apt-get remove --purge xserver-xorg-video-nouveau
sudo apt-get --purge remove nvidia-*

3-0 安装依赖
sudo apt update
sudo apt install dkms build-essential linux-headers-generic

3.开始安装
安装驱动程序
$sudo chmod a+x NVIDIA-Linux-x86_64-xxx.run
$sudo sh NVIDIA-Linux-x86_64-xxx.run
#–no-x-check 关闭X服务
#–no-nouveau-check 禁用nouveau
#–no-opengl-files 不安装OpenGL文件
4-0 安装完成后
sudo update-initramfs -u 内核更新
sudo reboot

卸载残留:

要强制卸载这两个模块,你可以使用dpkg命令来操作。请按照以下步骤进行:

  1. 打开终端,以管理员权限登录到你的系统。

  2. 运行以下命令来卸载linux-modules-nvidia-450-server-6.2.0-35-generic模块:

    sudo dpkg --purge linux-modules-nvidia-450-server-6.2.0-35-generic
    ```
  3. 运行以下命令来卸载linux-objects-nvidia-450-server-6.2.0-35-generic模块:

    sudo dpkg --purge linux-objects-nvidia-450-server-6.2.0-35-generic
    ```注意:在命令中替换版本号和架构(amd64)为你系统中实际安装的版本。
  4. 当命令执行完成后,这两个模块应该已被强制卸载。

最终效果:
在这里插入图片描述其他命令:

升级显卡驱动命令
输入如下指令查看系统推荐的驱动版本:
sudo ubuntu-drivers devices

auturemove命令
在Ubuntu中,你可以使用autoremove命令来自动删除不再需要的软件包和依赖项。这些软件包通常是由于你升级或删除其他软件包而变得不再需要的。

要使用autoremove命令,请按照以下步骤进行:

  1. 打开终端。

  2. 以管理员权限登录到你的系统。

  3. 运行以下命令来使用autoremove

    sudo apt autoremove
    ```
  4. 命令将扫描系统中不再需要的软件包和依赖项,并提示你确认是否删除它们。请仔细阅读删除列表上的软件包,确保你不再需要它们。

  5. 如果你确认要删除这些软件包,请输入"Y"或"yes",然后按回车键。

  6. autoremove命令将自动删除这些不再需要的软件包和依赖项。

请注意,使用autoremove命令时要小心,确保你了解要删除的软件包以及其对系统的影响。建议在执行之前先进行备份,并定期进行系统维护和清理。

tips:
为避免麻烦关闭自动更新显卡驱动

1.禁止自动升级

修改配置文件/etc/apt/apt.conf.d/10periodic
#0是关闭,1是开启,将所有值改为0
vi etc/apt/apt.conf.d/10periodic
APT::Periodic::Update-Package-Lists “0”;
APT::Periodic::Download-Upgradeable-Packages “0”;
APT::Periodic::AutocleanInterval “0”;

在这里插入图片描述

执行命令:
sudo apt-mark hold linux-image-generic linux-headers-generic
在这里插入图片描述
2 使用 apt-mark hold

apt-mark hold 命令可以帮助我们锁定某个软件包的版本,这样就可以防止 Ubuntu 自动更新该软件包。在这种情况下,我们可以使用 apt-mark hold 命令来锁定显卡驱动软件包的版本,从而防止 Ubuntu 自动更新显卡驱动。具体操作步骤如下:

打开终端,使用以下命令来查看当前安装的显卡驱动软件包:
dpkg -l | grep -i nvidia
执行以下命令将该软件包的版本锁定:
sudo apt-mark hold
其中, 表示需要锁定的显卡驱动软件包的名称,例如:nvidia-driver-450。

如果需要解除锁定,我们可以使用以下命令:
sudo apt-mark unhold
需要注意的是,该方法只会禁止 Ubuntu 自动更新显卡驱动,如果我们需要安装更新版本的显卡驱动,则需要手动执行 apt-get update 和 apt-get upgrade 命令

这篇关于Nvidia显卡Failed to initialize NVML Driver/library version mismatch错误解决方案的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/366342

相关文章

部署Vue项目到服务器后404错误的原因及解决方案

《部署Vue项目到服务器后404错误的原因及解决方案》文章介绍了Vue项目部署步骤以及404错误的解决方案,部署步骤包括构建项目、上传文件、配置Web服务器、重启Nginx和访问域名,404错误通常是... 目录一、vue项目部署步骤二、404错误原因及解决方案错误场景原因分析解决方案一、Vue项目部署步骤

在MySQL执行UPDATE语句时遇到的错误1175的解决方案

《在MySQL执行UPDATE语句时遇到的错误1175的解决方案》MySQL安全更新模式(SafeUpdateMode)限制了UPDATE和DELETE操作,要求使用WHERE子句时必须基于主键或索引... mysql 中遇到的 Error Code: 1175 是由于启用了 安全更新模式(Safe Upd

Python安装时常见报错以及解决方案

《Python安装时常见报错以及解决方案》:本文主要介绍在安装Python、配置环境变量、使用pip以及运行Python脚本时常见的错误及其解决方案,文中介绍的非常详细,需要的朋友可以参考下... 目录一、安装 python 时常见报错及解决方案(一)安装包下载失败(二)权限不足二、配置环境变量时常见报错及

Java下载文件中文文件名乱码的解决方案(文件名包含很多%)

《Java下载文件中文文件名乱码的解决方案(文件名包含很多%)》Java下载文件时,文件名中文乱码问题通常是由于编码不正确导致的,使用`URLEncoder.encode(filepath,UTF-8... 目录Java下载文件中文文件名乱码问题一般情况下,大家都是这样为了解决这个问题最终解决总结Java下

Idea实现接口的方法上无法添加@Override注解的解决方案

《Idea实现接口的方法上无法添加@Override注解的解决方案》文章介绍了在IDEA中实现接口方法时无法添加@Override注解的问题及其解决方法,主要步骤包括更改项目结构中的Languagel... 目录Idea实现接China编程口的方法上无法添加@javascriptOverride注解错误原因解决方

SpringBoot中的404错误:原因、影响及解决策略

《SpringBoot中的404错误:原因、影响及解决策略》本文详细介绍了SpringBoot中404错误的出现原因、影响以及处理策略,404错误常见于URL路径错误、控制器配置问题、静态资源配置错误... 目录Spring Boot中的404错误:原因、影响及处理策略404错误的出现原因1. URL路径错

MYSQL事务死锁问题排查及解决方案

《MYSQL事务死锁问题排查及解决方案》:本文主要介绍Java服务报错日志的情况,并通过一系列排查和优化措施,最终发现并解决了服务假死的问题,文中通过代码介绍的非常详细,需要的朋友可以参考下... 目录问题现象推测 1 - 客户端无错误重试配置推测 2 - 客户端超时时间过短推测 3 - mysql 版本问

Android kotlin语言实现删除文件的解决方案

《Androidkotlin语言实现删除文件的解决方案》:本文主要介绍Androidkotlin语言实现删除文件的解决方案,在项目开发过程中,尤其是需要跨平台协作的项目,那么删除用户指定的文件的... 目录一、前言二、适用环境三、模板内容1.权限申请2.Activity中的模板一、前言在项目开发过程中,尤

Linux内存泄露的原因排查和解决方案(内存管理方法)

《Linux内存泄露的原因排查和解决方案(内存管理方法)》文章主要介绍了运维团队在Linux处理LB服务内存暴涨、内存报警问题的过程,从发现问题、排查原因到制定解决方案,并从中学习了Linux内存管理... 目录一、问题二、排查过程三、解决方案四、内存管理方法1)linux内存寻址2)Linux分页机制3)

IDEA运行spring项目时,控制台未出现的解决方案

《IDEA运行spring项目时,控制台未出现的解决方案》文章总结了在使用IDEA运行代码时,控制台未出现的问题和解决方案,问题可能是由于点击图标或重启IDEA后控制台仍未显示,解决方案提供了解决方法... 目录问题分析解决方案总结问题js使用IDEA,点击运行按钮,运行结束,但控制台未出现http://