安装步骤
步骤1. 添加NVIDIA官方软件源 #
在您的系统中注册适用于Rocky Linux 9的NVIDIA CUDA官方软件源。运行以下命令将添加CUDA(NVIDIA)软件源。
sudo dnf config-manager --add-repo \
http://developer.download.nvidia.com/compute/cuda/repos/rhel9/$(uname -i)/cuda-rhel9.repo
执行后,NVIDIA软件源定义文件将被添加到/etc/yum.repos.d/中,此后您就可以从该软件源安装软件包了。
#
步骤2. 安装所需软件包 #
安装构建NVIDIA驱动程序以及使用CUDA所需的开发软件包。首先,启用EPEL(Extra Packages for Enterprise Linux)软件源以及包含开发软件包的CRB(CodeReady Builder)软件源。
这样可以使dkms等必要组件变为可用。
sudo dnf config-manager --set-enabled crb
sudo dnf install -y \
https://dl.fedoraproject.org/pub/epel/epel-release-latest-9.noarch.rpm \
https://dl.fedoraproject.org/pub/epel/epel-next-release-latest-9.noarch.rpm接下来,安装与当前运行内核相对应的内核头文件和开发软件包,以及开发工具。
以下命令将安装内核头文件、内核开发软件包(kernel-devel)、编译器(gcc/g++)、DKMS及其他必要工具($(uname -r)将被替换为您当前的内核版本)。
sudo dnf install -y kernel-headers-$(uname -r) kernel-devel-$(uname -r) \
make automake gcc gcc-c++ dkms pciutils elfutils-libelf-devel \
libglvnd-devel libglvnd-opengl libglvnd-glx bzip2 tar pkgconfig acpid注意:上述命令指定的是与当前运行内核版本相匹配的内核头文件和开发软件包。这些软件包将被安装以匹配Rocky Linux 9.3默认内核
5.14.0-362.8.1.el9_3.x86_64,从而使后续可以针对该内核构建模块。提前安装所需的软件包将使后续的驱动程序安装顺利进行。
步骤3. 安装NVIDIA驱动程序 #
使用DNF模块功能安装最新的NVIDIA驱动程序。您添加的NVIDIA软件源中包含多个驱动程序模块流,但这里我们将选择最新的DKMS版本驱动程序。请使用以下命令安装NVIDIA驱动程序。
sudo dnf module install -y nvidia-driver:latest-dkms执行过程中若出现GPG密钥导入确认提示,请输入”y“以接受。
这将通过DKMS构建并安装NVIDIA内核模块,并将其集成到您的系统中。安装完成后,您可以使用modinfo nvidia命令验证驱动程序模块信息。
步骤4. 安装CUDA 12.8 #
安装NVIDIA CUDA Toolkit 12.8。CUDA软件源中包含多个与CUDA相关的元软件包,但我们将使用cuda-toolkit-12-8软件包,它包含了开发所需的完整工具集(其中包含CUDA 12.8编译器和库,但不包含驱动程序)。
执行以下命令以安装CUDA Toolkit 12.8。
sudo dnf install -y cuda-toolkit-12-8上述操作将把编译器(nvcc)、CUDA库、头文件及其他组件安装到/usr/local/cuda-12.6/目录下。
要将CUDA的bin目录添加到PATH环境变量中,例如可以使用echo 'export PATH=/usr/local/cuda-12.6/bin:$PATH' >> ~/.bashrc进行配置(如有需要,也请设置LD_LIBRARY_PATH)。
步骤5. 应用系统设置并验证运行情况 #
重新启动系统以应用驱动程序,并配置使用指定内核进行启动。首先,将GRUB设置为默认使用已安装内核中的5.14.0-362.8.1.el9_3.x86_64版本内核启动。请执行以下命令,将合适的内核设置为默认启动项。
sudo grubby --set-default /boot/vmlinuz-5.14.0-362.8.1.el9_3.x86_64执行上述操作后,您可以使用grubby --default-index或grubby --info=ALL验证默认设置是否已生效。接下来,重新启动系统。重启后,首先验证内核版本是否为5.14.0-362.8.1.el9_3.x86_64(使用uname -r命令)。同时,为保险起见,请确认Nouveau驱动程序已被禁用(如有需要,请检查lsmod | grep nouveau是否没有输出。如需禁用,请追加blacklist nouveau至/etc/modprobe.d/blacklist-nouveau.conf,并使用dracut -f命令重新构建initramfs)。
最后,验证NVIDIA GPU是否被正确识别,以及驱动程序是否正常运行。使用lspci命令确认GPU是否被检测到(运行以下命令将显示NVIDIA GPU条目)。
lspci | grep -i NVIDIA如果上述命令显示了“NVIDIA Corporation …”条目,则说明GPU已在PCI总线上被识别。接下来,执行nvidia-smi命令以验证NVIDIA驱动程序的状态。
nvidia-smi如果安装已成功完成,将显示GPU列表、驱动程序版本以及可用内存等信息。
例如,如果RTX 6000 Ada对应的驱动程序已正确加载,则应显示GPU名称和可用的CUDA版本。至此,NVIDIA RTX 6000 Ada驱动程序和CUDA 12.6的安装与配置已完成。如有需要,请再次重启并确认启动时没有问题。
补充:关于lspci和nvidia-smi验证 #
lspci是用于显示PCI设备列表的命令。如上所示执行该命令,即可验证系统是否识别出NVIDIA GPU。nvidia-smi是NVIDIA的系统管理实用程序,可用于验证已安装的驱动程序是否正常工作(即是否识别出GPU)。- 如果在安装驱动程序后可以通过该命令获取GPU信息,则说明安装成功。