# Установка драйвера NVIDIA RTX Pro 6000 Blackwell

#Установка драйвера NVIDIA RTX Pro 6000 Blackwell

Отлично, всё сходится. Профиль nvidia_rtx_pro_6000_blackwell_dc-96c — вся карта целиком, 96 ГБ, C-серия (compute), то есть для vLLM это ровно то, что нужно. Мой прежний вывод про «профиль на 4 ГБ» был неверным — BAR1 в госте объём фреймбуфера не отражает.

По совместимости: Manager 595.91.04 из более старшей ветки, чем guest 580.95.05. Такая пара поддерживается — Manager может быть новее guest-драйвера на мажорную ветку, обратное нельзя. Так что версия рабочая.

## 1. Скачать и сразу сохранить копию

Ссылка живёт 7 дней, потом истечёт. Обязательно положи файл в Harbor или S3, чтобы не повторять всю эту историю.

```bash
mkdir -p /opt/nvidia && cd /opt/nvidia

wget -O NVIDIA-Linux-x86_64-580.95.05-grid.run \
"https://06f3557d98f44a6c9896014c980c5b74-ds1.s3.itgstore.io/andrey.kislitsyn/nvidia/NVIDIA-Linux-x86_64-580.95.05-grid.run?X-Amz-Algorithm=AWS4-HMAC-SHA256&X-Amz-Credential=5VWPCXGKV0PPUZQZKUI6%2F20260903%2Fus-east-1%2Fs3%2Faws4_request&X-Amz-Date=20260903T135006Z&X-Amz-Expires=604800&X-Amz-Security-Token=eyJhbGciOiJIUzUxMiIsInR5cCI6IkpXVCJ9.eyJhY2Nlc3NLZXkiOiI1VldQQ1hHS1YwUFBVWlFaS1VJNiIsImV4cCI6MTc4ODQ4NjU3NSwicGFyZW50IjoiaXRnbG9iYWxfcHUifQ.Z9QSbYSY29EKSZxp8jDiEsBDNDESrJdXjqh0FEc3wAmoSv90rW3VLgyl7xF1rcFpzrCLsDah4qZpL192uXpmYg&X-Amz-SignedHeaders=host&versionId=null&X-Amz-Signature=f5c6a5df680c32a5860d588eee807041648212c24a8805f69572b20ac7406bf5"

ls -la NVIDIA-Linux-x86_64-580.95.05-grid.run
sha256sum NVIDIA-Linux-x86_64-580.95.05-grid.run
sh NVIDIA-Linux-x86_64-580.95.05-grid.run --info | head -5
```

Кавычки вокруг URL обязательны — иначе & уронит команду в фон. Файл должен быть порядка 300–400 МБ; если пришло несколько килобайт, это XML с ошибкой доступа.

## 2. Снести репозиторный драйвер

Смешивать .run и пакеты нельзя — именно это и сломало систему. Container toolkit при этом сохраняем:

```bash
apt-get --purge remove -y $(dpkg-query -W -f='${Package} ${Status}\n' \
  | grep -v deinstall | awk '{print $1}' \
  | grep -E '^(nvidia|libnvidia|xserver-xorg-video-nvidia)' \
  | grep -v container) libxnvctrl0

apt-get autoremove --purge -y
dpkg -l | grep -i nvidia          # должны остаться только *container*
dkms status                        # записей nvidia быть не должно
```

Заодно закрыть nouveau, он подгружался в июньских загрузках:

```bash
printf 'blacklist nouveau\noptions nouveau modeset=0\n' > /etc/modprobe.d/blacklist-nouveau.conf
apt-get install -y linux-headers-$(uname -r) build-essential dkms
update-initramfs -u
reboot
```

Перезагрузка нужна, чтобы модули гарантированно выгрузились — инсталлятор откажется работать с загруженным nvidia.ko.

## 3. Установить драйвер

```bash
cd /opt/nvidia
chmod +x NVIDIA-Linux-x86_64-580.95.05-grid.run
./NVIDIA-Linux-x86_64-580.95.05-grid.run --dkms -m=kernel-open
```

-m=kernel-open — это то самое MIT/GPL, что выбирали в апреле, для Blackwell-vGPU нужен именно open-модуль. --dkms в апреле не использовали, из-за чего модуль был привязан к ядру 6.8.0-101; теперь он будет пересобираться при обновлении ядра сам.

Если инсталлятор всё же спросит тип модуля — отвечать MIT/GPL. На вопрос про nvidia-xconfig и X-конфигурацию можно отвечать отрицательно, X здесь не используется.

```bash
reboot
```

## 4. Проверить и активировать лицензию

Токен и gridd.conf на месте с апреля, так что лицензирование должно подняться само:

```bash
nvidia-smi
cat /etc/nvidia/gridd.conf
ls -la /etc/nvidia/ClientConfigToken/
systemctl enable --now nvidia-gridd
systemctl restart nvidia-gridd && systemctl status nvidia-gridd --no-pager
sleep 15
nvidia-smi -q | grep -i -A4 "License"
```

Ожидаемый результат: nvidia-smi показывает карту с ~96 ГБ, а в блоке лицензии — Licensed : Yes. Проверь, что инсталлятор не перезаписал gridd.conf; если файл опустел, восстанови:

```bash
printf 'FeatureType=1\nEnableUI=TRUE\nLicenseInterval=10080\n' > /etc/nvidia/gridd.conf
systemctl restart nvidia-gridd
```

FeatureType для vGPU роли не играет — тип лицензии определяется профилем, а -96C это C-серия. Раз в апреле работало, оставляем как есть.

Если лицензия не выдаётся при рабочем nvidia-smi — проблема уже не в драйвере, а в доступности NLS/DLS, и это вопрос к провайдеру. Логи в journalctl -u nvidia-gridd.

## 5. Docker и vLLM

```bash
nvidia-ctk runtime configure --runtime=docker
systemctl restart docker
docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
docker start qwen-next qwen-embeddings
docker logs -f --tail 50 qwen-next
```

## 6. Заблокировать повтор

Обязательно, иначе следующее apt install nvidia-* или автообновление снова снесёт grid-драйвер:

```bash
cat > /etc/apt/preferences.d/nvidia-block <<'EOF'
Package: nvidia-* libnvidia-* xserver-xorg-video-nvidia-*
Pin: release *
Pin-Priority: -1
EOF

# container toolkit нужно оставить доступным
cat > /etc/apt/preferences.d/nvidia-container-allow <<'EOF'
Package: nvidia-container-toolkit* libnvidia-container*
Pin: release *
Pin-Priority: 500
EOF

apt-get update
apt-cache policy nvidia-open-580   # Candidate должен стать недоступным
```

И оставь в /opt/nvidia/ рядом с .run короткий README: версия драйвера, что ставить с -m=kernel-open --dkms, что пакеты из репозитория запрещены. Следующий администратор об этом знать не будет.
