跳至内容
龙讯旷腾 pwmat Wiki
用户工具
注册
登录
站点工具
搜索
工具
显示页面
过去修订
全部折叠/展开
反向链接
最近更改
媒体管理器
网站地图
注册
登录
>
English
最近更改
媒体管理器
网站地图
您的足迹:
pwstudio:ubuntu_gpu
本页面只读。您可以查看源文件,但不能更改它。如果您觉得这是系统错误,请联系管理员。
====== PWstudio gpu 版在 ubuntu 24.04 下安装 ====== 适用系统:Ubuntu 24.04 LTS\\ 包含:PWstudio gpu 版与现有主流容器版 GPU 应用相同,都在运行时依赖 NVIDIA 显卡驱动、Docker、nvidia-container-toolkit,安装 PWstudio gpu 版前请先确定您的机器已经安装这些依赖项。本手册中提供了这些依赖项的安装步骤,您可以参考安装。 <wrap important> 在开始之前,强烈建议先看一遍 [[pwstudio:readme|PWstudio 安装前必看]],尤其是里面关于"复制粘贴"和"命令提示符不是命令的一部分"的说明。如果你还不会用工具登录服务器、上传下载文件,先看 [[pwstudio:mobaxterm|MobaXterm 新手教程]]。 </wrap> ---- ===== 1. 安装 NVIDIA 显卡驱动 ===== <wrap tip> 如果你的机器之前已经装过驱动,可以先做 1.2 检查一下,如果有输出就可以跳过整个第 1 章节,直接进入"2. 安装 Docker"。 </wrap> ==== 1.1 确认系统能识别到 NVIDIA 显卡 ==== <code bash> lspci | grep -i nvidia </code> * **有输出**(能看到包含 "NVIDIA" 字样的一行文字):说明识别到了显卡,继续往下。 * **没有输出**:说明没识别到显卡,先联系管理员确认硬件是否正常,不要继续装 GPU 驱动。 ==== 1.2 检查驱动是否已经安装 ==== <code bash> nvidia-smi </code> 如果能看到显卡型号、驱动版本、CUDA 版本等信息,说明驱动已经安装, <color blue>跳过这一步</color>。也就是说 1.3~1.7 都不用做了,直接去第 2 章节"安装 Docker"。若提示 "command not found",说明还没装,请继续下面的步骤。 ==== 1.3 禁用系统自带的 nouveau 驱动 ==== <code bash> # 1. 先禁用 nouveau sudo bash -c "echo blacklist nouveau > /etc/modprobe.d/blacklist-nvidia-nouveau.conf" sudo bash -c "echo options nouveau modeset=0 >> /etc/modprobe.d/blacklist-nvidia-nouveau.conf" sudo update-initramfs -u # 2. 重启系统(让 nouveau 禁用生效) sudo reboot </code> <wrap important> 执行 ''sudo reboot'' 后,终端连接会断开,这是正常且必须的现象,不用担心。请等待 1-2 分钟让服务器完成重启,然后**重新登录服务器**(比如用 MobaXterm 重新连接一次),登录成功后再继续下面 1.4 的步骤。 </wrap> ==== 1.4 更新软件源 ==== <code bash> sudo apt update </code> 这条命令是刷新一下软件源列表,执行后会滚动显示各个源的检查信息,正常现象,跑完即可,不需要额外操作。 ==== 1.5 安装必要工具 ==== <code bash> sudo apt install -y ubuntu-drivers-common </code> ==== 1.6 安装指定版本驱动 ==== <code bash> # 安装 535 版本驱动(支持 CUDA 12.1 及以上) sudo ubuntu-drivers install nvidia:535 </code> > 如需查看系统推荐驱动版本,可先执行 ''sudo ubuntu-drivers list'' 参考输出结果。 这一步会下载并安装驱动,根据网速可能需要几分钟,请耐心等待,中途不要强行关闭终端。 ==== 1.7 重启系统 ==== <code bash> sudo reboot </code> 同样,执行后终端会断开,属于正常现象,等待 1-2 分钟后重新登录服务器。 ==== 1.8 验证驱动安装 ==== <code bash> nvidia-smi </code> <wrap important> 注意 ''nvidia-smi'' 中间是短横线,没有空格,建议直接复制粘贴执行,不要手动敲。 </wrap> 如果能看到显卡型号、驱动版本、CUDA 版本等信息,**说明驱动已成功安装(如下图例所示,看到类似这样的表格就说明成功了)**: NVIDIA-SMI 535.309.01 为命令行工具本身的版本号,是用来查询GPU状态的可执行程序; Driver Version: 535.309.01 是 NVIDIA 显卡内核驱动 的版本号。它是真正掌管GPU硬件、与操作系统内核交互的核心底层程序; CUDA Version: 12.2 是当前驱动所能支持的最高 CUDA 运行时(Runtime)版本。只要CUDA应用程序(如PyTorch、TensorFlow)依赖的CUDA版本 不超过 12.2,就可以正常调用GPU。 {{:pwstudio:nvidia-smi.png?400|}} ---- ===== 2. 安装 Docker ===== 安装前请先确认您的机器是否未安装docker: <code bash> docker --version # 如果输出类似 Docker version 29.6.1, build 8900f1d 信息,则表示已安装docker,可以跳过本章节,直接进入"3. 安装 nvidia-container-toolkit" systemctl status docker # 检查检查 Docker 服务是否运行,显示 active (running) ,则不仅安装了,服务也在运行 </code> ==== 2.1 安装必要的依赖 ==== <code bash> sudo apt update sudo apt install -y ca-certificates curl </code> ==== 2.2 添加 Docker 的官方 GPG 密钥和软件源(使用国内镜像站) ==== <code bash> # 1. 创建存放密钥的目录 sudo install -m 0755 -d /etc/apt/keyrings # 2. 从阿里云镜像站下载并保存 Docker 的 GPG 密钥 sudo curl -fsSL http://mirrors.aliyun.com/docker-ce/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc sudo chmod a+r /etc/apt/keyrings/docker.asc # 3. 添加 Docker 软件源(同样使用阿里云镜像地址) echo \ "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] http://mirrors.aliyun.com/docker-ce/linux/ubuntu \ $(. /etc/os-release && echo "${UBUNTU_CODENAME:-$VERSION_CODENAME}") stable" | \ sudo tee /etc/apt/sources.list.d/docker.list > /dev/null </code> <wrap tip> 第 3 步这一整段(从 ''echo'' 到最后的 ''> /dev/null'')建议整体一起复制粘贴执行,不要拆开分行执行,因为它本身就是一条跨行的命令。其中 ''$(dpkg --print-architecture)'' 和 ''$(. /etc/os-release && echo ...)'' 都是系统自动变量,会自动替换成你系统的架构和版本代号,**不需要手动修改**。 </wrap> ==== 2.3 安装 Docker ==== <code bash> # 再次更新软件包索引 sudo apt update # 安装 Docker 及其组件 sudo apt install -y docker-ce docker-ce-cli containerd.io docker-buildx-plugin docker-compose-plugin </code> 这一步会下载安装 Docker 及相关组件,根据网速可能需要一两分钟。 ==== 2.4 启动并设置开机自启 ==== <code bash> sudo systemctl start docker sudo systemctl enable docker </code> ==== 2.5 验证安装 ==== <code bash> sudo docker run --rm swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/hello-world:latest # 展示类似如下信息则表示安装成功 # Hello from Docker! # This message shows that your installation appears to be working correctly. # To generate this message, Docker took the following steps: # 1. The Docker client contacted the Docker daemon. # 2. The Docker daemon pulled the "hello-world" image from the Docker Hub. (amd64) # 3. The Docker daemon created a new container from that image which runs the executable that produces the output you are currently reading. # 4. The Docker daemon streamed that output to the Docker client, which sent it to your terminal. # To try something more ambitious, you can run an Ubuntu container with: # $ docker run -it ubuntu bash </code> **只要你在终端里看到 "Hello from Docker!" 这几个字,就说明 Docker 已经安装成功、并且能正常工作了**,可以放心进行下一步。 ==== 2.6 (可选)配置非 root 用户权限 ==== <code bash> sudo usermod -aG docker $USER </code> <wrap important> 这里的 ''$USER'' 是系统自动变量,会自动替换成你当前登录的用户名,**不需要你手动改成自己的用户名**,原样复制粘贴执行即可。 </wrap> > 注意:需要重新登录或重启会话才能生效,也就是说执行完这条命令后,先退出终端(输入 ''exit''),再重新登录一次服务器,这条设置才会真正生效。 ---- ===== 3. 安装 nvidia-container-toolkit ===== > Ubuntu 24.04 推荐使用 NVIDIA 官方 apt 仓库安装,不再使用已废弃的 ''apt-key add'' 方式。 ==== 3.1 下载离线包并上传到服务器 ==== > 链接:http://223.70.160.60:9999/qflow/nvidia-container-toolkit_1.19.1_deb_amd64.tgz > 用户名:pwmat > 密码: SimplyTheBest 可在服务器直接下载(如果你的服务器能直接访问外网,可以省去"浏览器下载再上传"这一步,直接在服务器终端执行下面命令): <code bash> wget --user=pwmat --password=SimplyTheBest "http://223.70.160.60:9999/qflow/nvidia-container-toolkit_1.19.1_amd64.deb.tgz" </code> 如果服务器不能直接访问外网,就跟前面驱动、Docker 一样,先用浏览器打开上面链接下载到本地,再用 MobaXterm 上传到服务器。 ==== 3.2 安装 nvidia-container-toolkit ==== <code bash> tar -zxvf nvidia-container-toolkit_1.19.1_deb_amd64.tgz cd nvidia-container-toolkit_1.19.1_deb_amd64 sudo dpkg -i *.deb </code> 第一条解压,第二条进入解压出来的文件夹,第三条安装里面所有的 ''.deb'' 安装包。 ==== 3.3 配置 Docker 运行时 ==== <code bash> sudo nvidia-ctk runtime configure --runtime=docker </code> ==== 3.4 重启 Docker 服务 ==== <code bash> sudo systemctl restart docker </code> <wrap tip> 3.3 和 3.4 这两步只需要执行一次,配置好以后就一直生效,不需要每次使用 Docker 前都重新做一遍。 </wrap> ==== 3.5 验证安装 ==== <code bash> sudo docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:12.4.0-base-ubuntu22.04 nvidia-smi </code> 如果容器内能正常输出 ''nvidia-smi'' 信息(如下图所示,能看到显卡型号、驱动版本等信息),说明 nvidia-container-toolkit 安装成功,容器已经能正常使用 GPU 了。 {{:pwstudio:docker-install-check.png?400|}} ===== 4. PWstudio gpu 版安装 ===== 点击链接, 从 ''宿主机安装 server.py 服务'' 开始: [[pwstudio:quickstart_gpu#宿主机安装 server.py 服务|跳转到宿主机安装 server.py 服务章节]] 跟着文档安装到结尾 ~~DISCUSSION:off~~
pwstudio/ubuntu_gpu.txt
· 最后更改: 2026/07/28 03:16 由
127.0.0.1
页面工具
显示页面
过去修订
反向链接
全部折叠/展开
回到顶部