← 返回博客

GPU 云主机跑推理前的磁盘与驱动检查

在租 GPU VPS 后,先确认驱动、CUDA、磁盘 inode,再拉模型。

TensorView Lab · 2026-09-08

上机第一小时

nvidia-smi
df -h
df -i
free -h
  • 驱动与 CUDA 用户态不匹配会直接 CUDA error
  • 小盘拉取 7B/14B 量化模型时经常 No space left,其实是 inode 或 overlay 满

Docker 场景

docker run --rm --gpus all nvidia/cuda:12.4.0-base-ubuntu22.04 nvidia-smi

失败时优先查 nvidia-container-toolkit,而不是模型代码。

模型目录

把权重放到数据盘并软链,避免把根分区写爆:

sudo mkdir -p /data/models
sudo ln -s /data/models ~/models

推理服务对外时,务必只暴露 API 网关,不要把 Jupyter 裸奔在 8888。

也可以试试 TensorView 小工具集合