====== PWstudio gpu 版在 rocky8.10 下安装 ======
适用系统:Rocky Linux 8.10\\
包含:NVIDIA 显卡驱动、Docker、nvidia-container-toolkit
在开始之前,强烈建议先看一遍 [[pwstudio:readme|PWstudio 安装前必看]],尤其是里面关于"复制粘贴"和"命令提示符不是命令的一部分"的说明。如果你还不会用工具登录服务器、上传下载文件,先看 [[pwstudio:mobaxterm|MobaXterm 新手教程]]。
----
===== 1. 系统设置 =====
==== 1.1 关防火墙 ====
第一条命令是立即关闭防火墙,第二条是设置开机不再自动启动防火墙:
sudo systemctl stop firewalld
sudo systemctl disable firewalld
这两条命令正常情况下没有输出,或只有很短的提示,只要没有报红色错误就说明执行成功。
===== 2. 安装 NVIDIA 显卡驱动 =====
==== 2.1 确认系统能识别到 NVIDIA 显卡 ====
# 安装硬件检查工具
sudo dnf install pciutils -y
# 识别显卡信息
lspci | grep -i nvidia
第一条命令是安装一个叫 ''pciutils'' 的小工具(里面包含 ''lspci'' 命令),如果之前已经装过,这条命令会提示"已经是最新版本"之类的信息,属于正常现象,不影响继续。第二条命令才是真正检查显卡:
* **有输出**(能看到一行包含 "NVIDIA" 字样的文字):说明系统识别到了 NVIDIA 显卡,继续往下走。
* **没有任何输出**:说明没识别到 NVIDIA 显卡,先联系管理员确认硬件,不要继续安装 GPU 驱动。
==== 2.2 检查驱动是否已经安装 ====
nvidia-smi
如果能看到显卡型号、驱动版本、CUDA 版本(CUDA Version:12.1 以上)等信息,**说明驱动已经正常安装**,可以直接跳到第 3 步"安装 Docker",中间 2.3~2.7 全部跳过;若提示 "command not found"(未识别到驱动版本),说明还没装驱动,请继续完成下面 2.3~2.7 的安装操作。
==== 2.3 安装依赖包 ====
# 安装开发工具组
sudo dnf groupinstall "Development Tools" -y
# 安装与当前内核匹配的开发包
sudo dnf install -y kernel-devel-$(uname -r) kernel-headers-$(uname -r)
# 启用必要的软件仓库
sudo dnf install epel-release -y
# 安装 DKMS,帮助内核更新后自动重建驱动
sudo dnf install -y dkms
命令里的 ''$(uname -r)'' 会被系统自动替换成你当前系统内核的版本号,**不需要手动修改成别的内容(比如你自己的用户名)**,请原样整行复制粘贴执行。
这四条命令建议依次整段复制粘贴执行,每一条执行完都会滚动输出一些软件包安装信息,属于正常现象,跑完没有报红色 Error 即可。
==== 2.4 禁用系统自带的 nouveau 驱动 ====
sudo grubby --args="nouveau.modeset=0 rd.driver.blacklist=nouveau" --update-kernel=ALL
# 重启系统使配置生效
sudo reboot
''sudo reboot'' 会让服务器立即重启,这是正常且必须的步骤。执行后终端连接会断开,属于正常现象,不用担心。请等待 1-2 分钟,让服务器完成重启,然后**重新登录服务器**(用 MobaXterm 之类的工具),登录成功后再继续 2.5。
==== 2.5 使用 DNF 包管理器安装驱动 ====
# 启用必要的软件仓库
sudo dnf config-manager --set-enabled powertools
# 添加 NVIDIA 官方仓库
sudo tee /etc/yum.repos.d/cuda-rhel8.repo << 'EOF'
[cuda-rhel8-x86_64]
name=cuda-rhel8-x86_64
baseurl=https://developer.download.nvidia.com/compute/cuda/repos/rhel8/x86_64
enabled=1
gpgcheck=1
gpgkey=https://developer.download.nvidia.com/compute/cuda/repos/rhel8/x86_64/D42D0685.pub
EOF
# 启用 nvidia-driver 模块的 latest-dkms 流(推荐使用 DKMS)
sudo dnf module enable nvidia-driver:570-dkms -y
# 安装驱动
sudo dnf install -y cuda-drivers
其中 ''sudo tee ... << 'EOF' ... EOF'' 这一段建议**整段一起复制粘贴**(从 ''sudo tee'' 一直到最后的 ''EOF''),不要拆开单独执行,因为这是在写入一个多行的配置文件。执行后屏幕上会把这段内容原样打印出来,这是正常现象,不是报错。最后一条 ''dnf install -y cuda-drivers'' 是真正安装驱动,会下载并安装比较多的软件包,根据网速可能需要几分钟,请耐心等待。
==== 2.6 重启系统 ====
sudo reboot
同样,执行后会断开连接,属于正常现象,请等待 1-2 分钟后重新登录服务器。
==== 2.7 验证驱动安装 ====
nvidia-smi
注意 ''nvidia-smi'' 中间是短横线,没有空格,建议直接复制粘贴,不要手动敲。
如果能看到显卡型号、驱动版本、CUDA 版本等信息的表格,**说明驱动已经成功安装**,可以继续下一步;如果仍然提示找不到命令,请检查前面 2.5 的安装过程是否有报错。
----
===== 3. 安装 Docker =====
如果你的机器已经装过 Docker(可以用如下命令检查,能看到版本号就说明装过了)
docker --version
本章节可以跳过,直接进入"4. 安装 nvidia-container-toolkit"。
==== 3.1 安装依赖并添加 Docker 官方仓库 ====
# 安装依赖工具
sudo dnf install -y dnf-utils device-mapper-persistent-data lvm2
# 添加 Docker 官方仓库(使用阿里云镜像加速)
sudo dnf config-manager --add-repo \
https://mirrors.aliyun.com/docker-ce/linux/centos/docker-ce.repo
第二条命令是把国内阿里云镜像站的 Docker 软件源加入到系统里,这样后面下载 Docker 会更快、更稳定(不容易因为访问境外网络而超时失败)。
==== 3.2 安装 Docker 引擎 ====
sudo dnf install -y docker-ce docker-ce-cli containerd.io
这条命令会安装 Docker 本体,根据网速可能需要一两分钟,安装过程会滚动很多软件包信息,属于正常现象。
如果这一步报错提示与 podman 冲突(Rocky/CentOS 8 系统有时会自带 podman),可以参考 [[pwstudio:qa:q102|q102 rocky 8.10 安装 docker 报错]] 里的解决办法。
==== 3.3 启动并设置开机自启 ====
sudo systemctl start docker
sudo systemctl enable docker
第一条启动 Docker 服务,第二条设置开机自动启动,一般没有输出或只有简单提示,属于正常现象。
==== 3.4 验证安装 ====
sudo docker run --rm swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/hello-world:latest
**如果你看到一段以 "Hello from Docker!" 开头的文字**,就说明 Docker 已经成功安装了。
==== 3.5 (可选)配置非 root 用户权限 ====
sudo usermod -aG docker $USER
''$USER'' 是系统自动变量,会自动替换成你当前的登录用户名,**不需要手动修改**,原样复制粘贴执行即可。
> 注意:需要重新登录或重启会话才能生效,也就是执行完之后先 ''exit'' 退出,再重新登录一次服务器。
----
===== 4. 安装 nvidia-container-toolkit =====
这一步的作用是让 Docker 容器能够使用宿主机上的 NVIDIA GPU。
如果是 PWstudio cpu 版本安装, 请跳回之前的页面
==== 4.1 安装 nvidia-container-toolkit ====
sudo dnf install -y nvidia-container-toolkit
==== 4.2 配置 Docker 运行时 ====
sudo nvidia-ctk runtime configure --runtime=docker
==== 4.3 重启 Docker 服务 ====
# 务必重启 Docker 服务使配置生效
sudo systemctl restart docker
4.2 和 4.3 这两步只需要执行一次,不是每次用 Docker 都要重新做,配置好之后就一直生效了。
==== 4.4 验证安装 ====
sudo docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:12.4.0-base-ubuntu22.04 nvidia-smi
如果容器内能正常输出 ''nvidia-smi'' 信息(能看到显卡型号、驱动版本等),说明 nvidia-container-toolkit 安装成功,容器已经可以正常使用 GPU 了。
===== 5. PWstudio gpu 版安装 =====
三样基础环境都装好后,点击链接继续安装 PWstudio 本身, 从 ''宿主机安装 server.py 服务'' 开始: [[pwstudio:quickstart_gpu#宿主机安装 server.py 服务|跳转到宿主机安装 server.py 服务章节]] 跟着文档安装到结尾
~~DISCUSSION:off~~