Linux深度学习环境搭建全流程指南
|
Linux系统是深度学习开发的主流平台,稳定高效且生态丰富。选择Ubuntu 20.04或22.04 LTS版本最为稳妥,它们长期支持、驱动兼容性好,社区资源充足。安装时建议勾选“安装第三方软件”选项,以便自动配置基础图形驱动和Wi-Fi固件。 NVIDIA显卡是深度学习加速的核心,需先确认GPU型号并安装对应版本的驱动。访问nvidia.com/drivers下载.run文件,安装前执行sudo systemctl set-default multi-user.target切换至命令行模式,禁用nouveau驱动(在/etc/modprobe.d/blacklist.conf中添加blacklist nouveau),再运行sudo ./NVIDIA-Linux-.run —no-opengl-files完成安装。重启后用nvidia-smi验证驱动是否正常工作。 CUDA Toolkit提供GPU并行计算基础能力,版本必须与驱动和后续框架严格匹配。例如,CUDA 11.8兼容驱动版本≥450.80.02,同时适配PyTorch 2.0+和TensorFlow 2.12+。从developer.nvidia.com/cuda-toolkit-archive下载离线安装包,按官方指引执行安装脚本,并将/usr/local/cuda-11.8/bin加入PATH、/usr/local/cuda-11.8/lib64加入LD_LIBRARY_PATH,写入~/.bashrc后source生效。
2026建议图AI生成,仅供参考 cuDNN是CUDA的神经网络加速库,需登录NVIDIA开发者账号下载对应CUDA版本的tgz包。解压后复制include子目录到/usr/local/cuda/include,lib子目录内容到/usr/local/cuda/lib64,再运行sudo ldconfig更新动态链接缓存。注意检查权限,确保所有文件可被普通用户读取。Python环境推荐使用Miniconda管理,轻量且隔离性强。下载安装脚本后执行bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3,然后运行$HOME/miniconda3/bin/conda init bash并重启终端。创建独立环境:conda create -n dl python=3.9,conda activate dl,避免系统Python被污染。 框架安装优先选用官方预编译包。PyTorch通过pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 安装CUDA 11.8版;TensorFlow则使用pip install tensorflow-gpu==2.12.0(已内置CUDA/cuDNN绑定)。安装后在Python中分别执行import torch; print(torch.cuda.is_available())和import tensorflow as tf; print(tf.config.list_physical_devices('GPU'))确认GPU可用。 为提升开发效率,可选配Jupyter Lab:pip install jupyterlab,启动后浏览器访问http://localhost:8888,通过nbextension或jupyter-tensorboard插件集成可视化工具。VS Code配合Python和Remote-SSH扩展,能无缝连接远程训练服务器,实现本地编辑、远程运行。 每次更新驱动或CUDA后,务必重新验证cuDNN路径、环境变量及框架GPU检测结果。常见问题包括CUDA_VISIBLE_DEVICES未设置导致多卡识别异常、conda环境未激活导致pip安装到系统Python、以及防火墙拦截Jupyter端口等。善用nvidia-smi、nvcc --version、python -c "import sys; print(sys.path)"等命令快速定位问题根源。 (编辑:站长网) 【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容! |

