在 Rocky Linux 9.3 上安裝 NVIDIA 驅動程式與 CUDA

在 Rocky Linux 9.3 上安裝 NVIDIA 驅動程式與 CUDA

1 min read

安裝程序

STEP1. 新增官方 NVIDIA 儲存庫 #

在系統上註冊適用於 Rocky Linux 9 的官方 NVIDIA CUDA 儲存庫。執行以下指令即可新增 CUDA(NVIDIA)儲存庫。

sudo dnf config-manager --add-repo \
  http://developer.download.nvidia.com/compute/cuda/repos/rhel9/$(uname -i)/cuda-rhel9.repo

執行後,NVIDIA 儲存庫定義檔會被新增至 /etc/yum.repos.d/,之後即可從此儲存庫安裝套件。

#

STEP2. 安裝所需套件 #

安裝建置 NVIDIA 驅動程式與使用 CUDA 所需的開發套件。首先啟用 EPEL(Extra Packages for Enterprise Linux)儲存庫,以及包含開發套件的 CRB(CodeReady Builder)儲存庫。

如此可讓 dkms 等必要元件可供使用。

sudo dnf config-manager --set-enabled crb
sudo dnf install -y \
  https://dl.fedoraproject.org/pub/epel/epel-release-latest-9.noarch.rpm \
  https://dl.fedoraproject.org/pub/epel/epel-next-release-latest-9.noarch.rpm

接著,安裝對應目前執行中核心的核心標頭檔與開發套件,以及開發工具。

以下指令會安裝核心標頭檔、核心開發套件(kernel-devel)、編譯器(gcc/g++)、DKMS 及其他必要工具($(uname -r) 會被替換為您目前的核心版本)。

sudo dnf install -y kernel-headers-$(uname -r) kernel-devel-$(uname -r) \
  make automake gcc gcc-c++ dkms pciutils elfutils-libelf-devel \
  libglvnd-devel libglvnd-opengl libglvnd-glx bzip2 tar pkgconfig acpid

注意:以上指令指定的是與目前執行中核心版本相符的核心標頭檔與開發套件。這些套件會安裝為符合 Rocky Linux 9.3 預設核心 5.14.0-362.8.1.el9_3.x86_64,以便之後可針對此核心建置模組。事先安裝好所需套件,可讓後續的驅動程式安裝順利進行。

STEP3. 安裝 NVIDIA 驅動程式 #

使用 DNF 模組功能安裝最新版 NVIDIA 驅動程式。您新增的 NVIDIA 儲存庫包含多個驅動程式模組串流,這裡我們選擇最新的 DKMS 版驅動程式。請使用以下指令安裝 NVIDIA 驅動程式。

sudo dnf module install -y nvidia-driver:latest-dkms

若執行期間出現 GPG 金鑰匯入確認畫面,請輸入「y」以接受。

此操作會透過 DKMS 建置並安裝 NVIDIA 核心模組,並將其整合至您的系統中。安裝完成後,您可以使用 modinfo nvidia 指令確認驅動程式模組資訊。

STEP4. 安裝 CUDA 12.8 #

安裝 NVIDIA CUDA Toolkit 12.8。CUDA 儲存庫包含多個與 CUDA 相關的中繼套件,這裡我們使用 cuda-toolkit-12-8 套件,其中包含開發所需的完整工具組(此套件包含 CUDA 12.8 編譯器與函式庫,但不含驅動程式)。

請執行以下指令安裝 CUDA Toolkit 12.8。

sudo dnf install -y cuda-toolkit-12-8

以上指令會將編譯器(nvcc)、CUDA 函式庫、標頭檔及其他元件安裝至 /usr/local/cuda-12.6/ 底下。

若要將 CUDA 的 bin 目錄加入 PATH 環境變數,例如可透過 echo 'export PATH=/usr/local/cuda-12.6/bin:$PATH' >> ~/.bashrc 進行設定(如有需要,也請一併設定 LD_LIBRARY_PATH)。

STEP5. 套用系統設定並驗證運作 #

重新啟動系統以套用驅動程式,並將其設定為以指定核心開機。首先,將 GRUB 設定為預設以 5.14.0-362.8.1.el9_3.x86_64 核心版本從已安裝的核心中開機。請執行以下指令,將適當的核心設為預設開機項目。

sudo grubby --set-default /boot/vmlinuz-5.14.0-362.8.1.el9_3.x86_64

執行以上指令後,您可以使用 grubby --default-index 或 grubby --info=ALL 確認預設值已設定完成。接著,重新啟動系統。重新啟動後,請先確認核心版本為 5.14.0-362.8.1.el9_3.x86_64(可使用 uname -r 指令確認)。同時,請確認 Nouveau 驅動程式已停用以策安全(如有需要,可確認 lsmod | grep nouveau 無任何輸出。若需停用,請將 blacklist nouveau 加入至 /etc/modprobe.d/blacklist-nouveau.conf,並使用 dracut -f 指令重建 initramfs)。

最後,驗證 NVIDIA GPU 是否正確被辨識,以及驅動程式是否正常運作。使用 lspci 指令確認已偵測到 GPU(執行以下指令會顯示 NVIDIA GPU 項目)。

lspci | grep -i NVIDIA

若上述指令顯示出 「NVIDIA Corporation …」 項目,即表示 GPU 已在 PCI 匯流排上被辨識。接著,執行 nvidia-smi 指令以確認 NVIDIA 驅動程式狀態。

nvidia-smi

若安裝已順利完成,畫面會顯示 GPU 清單、驅動程式版本及可用記憶體等資訊。

例如,若對應 RTX 6000 Ada 的驅動程式已正確載入,畫面應會顯示 GPU 名稱及可用的 CUDA 版本。至此,RTX 6000 Ada 驅動程式與 CUDA 12.6 的安裝與設定即已完成。如有需要,請再次重新啟動並確認開機時沒有問題。

補充說明:關於 lspci 與 nvidia-smi 的驗證 #

  • lspci 是用來顯示 PCI 裝置清單的指令。如上所示執行後,即可確認系統已辨識到 NVIDIA GPU。
  • nvidia-smi 是 NVIDIA 的系統管理工具,可用來確認已安裝的驅動程式是否正常運作(亦即是否有辨識到 GPU)。
  • 若在安裝驅動程式後,透過此指令可以取得 GPU 資訊,即代表安裝成功。

Updated on 2026年6月9日

What are your feelings

  • Happy
  • Normal
  • Sad

©2020 BESTNET.LLC . All Rights Reserved.