Дополнение CCE AI Suite (NVIDIA GPU) помогает использовать и управлять GPU в ваших кластерах. Оно поддерживает доступ к GPU в контейнерах и помогает эффективно запускать и поддерживать вычислительные нагрузки, основанные на GPU, в облачных нативных средах. С этим дополнением как стандартные, так и Turbo кластеры CCE могут выполнять планирование GPU, автоматически устанавливать драйверы, управлять средами выполнения и мониторить производительность. Это означает полную поддержку GPU‑нагрузок на протяжении всего их жизненного цикла. Чтобы запускать узлы GPU в кластере, необходимо установить это дополнение.
nvidia-gpu-device-plugin является одним из основных компонентов CCE AI Suite (NVIDIA GPU). Как мост между платформой контейнеров и аппаратным обеспечением GPU, nvidia-gpu-device-plugin абстрагирует физические GPU в ресурсы, которые могут быть идентифицированы и запланированы платформой контейнеров. Это решает проблемы распределения и использования GPU в контейнеризованных средах.
Этот компонент работает как DaemonSet, чтобы GPU на каждом узле могли быть обнаружены kubelet и переданы в Kubernetes. Для использования GPU на узлах достаточно указать запросы ресурсов GPU в спецификациях pod. kubelet сам по себе не обнаруживает GPU‑устройства автоматически. Вместо этого он полагается на nvidia-gpu-device-plugin для регистрации и передачи информации о GPU. nvidia-gpu-device-plugin запускается на каждом узле с GPU и использует протокол gRPC для связи с kubelet Device Plugin Manager и завершения регистрации. Ниже показан рабочий процесс. Рисунок 1 Отчет о ресурсах GPU и их состоянии
Если версия дополнения 2.7.40 или новее, DCGM-Exporter может быть развернут. DCGM-Exporter сохраняет возможности сообщества и не поддерживает режим совместного использования или виртуализацию GPU.
Параметр | Description |
|---|---|
Default Cluster Driver | Все GPU‑узлы в кластере используют один и тот же драйвер. Вы можете выбрать подходящую версию драйвера GPU или настроить ссылку на драйвер и ввести ссылку для загрузки драйвера NVIDIA. |
После установки дополнения вы можете настроить виртуализацию GPU и драйверы пула узлов на вкладке Heterogeneous Resources в Settings.
Если дополнение удалено, новые GPU‑pod‑ы, запланированные на узлы, не смогут работать корректно, однако уже работающие GPU‑pod‑ы на узлах не будут затронуты.
После установки дополнения выполните команду nvidia-smi на GPU‑узле и в контейнере, который планирует ресурсы GPU, чтобы проверить доступность устройства GPU и драйвера.
cd /opt/cloud/cce/nvidia/bin && ./nvidia-smi
cd /usr/local/nvidia/bin && ./nvidia-smi
cd /usr/local/nvidia/bin && ./nvidia-smi
cd /usr/bin && ./nvidia-smi
Если возвращена информация о GPU, устройство доступно и add-on установлен.

После установки add-on вы можете при необходимости выполнить его обновление или откат. Перед обновлением или откатом add-on CCE AI Suite (NVIDIA GPU) убедитесь, что на GPU‑node не запущены рабочие нагрузки виртуализации GPU. Если на GPU‑node есть такие нагрузки, при обновлении или откате add-on необходимо освободить (drain) GPU‑node.
Согласно этой политике, CCE не предоставляет техническую поддержку для GPU drivers, достигших EOL, включая установку и обновление драйверов. The following drivers have reached EOL: 510.47.03, 470.141.03, and 470.57.02.
GPU Model | Supported Cluster Type | Specification | OS | OS | OS |
|---|---|---|---|---|---|
HCE OS 2.0 | Ubuntu 22.04 | CentOS Linux release 7.6 | |||
Tesla T4 | CCE standard cluster | g6 pi2 | 570.86.15 535.216.03 535.161.08 535.54.03 510.47.03 470.57.02 | 570.86.15 535.216.03 535.161.08 535.54.03 | 535.216.03 535.161.08 535.54.03 510.47.03 470.141.03 470.57.02 |
Tesla V100 | CCE standard cluster | p2s p2vs p2v | 570.86.15 535.216.03 535.161.08 535.54.03 510.47.03 470.57.02 | 570.86.15 535.216.03 535.161.08 535.54.03 | 535.216.03 535.161.08 535.54.03 510.47.03 470.141.03 470.57.02 |
Версия драйвера | Ubuntu 22.04 | CentOS Linux release 7.6 |
|---|---|---|
Ubuntu 22.04.z LTS (where z ≤ 5) | Не поддерживается | |
Ubuntu 22.04.z LTS (where z ≤ 4) | CentOS 7.y (where y ≤ 9) | |
Ubuntu 22.04.z LTS (where z ≤ 3) | CentOS 7.y (where y ≤ 9) | |
Ubuntu 22.04.z LTS (where z ≤ 2) | CentOS 7.y (where y ≤ 9) | |
Не поддерживается | CentOS 7.y (где y ≤ 9) | |
Не поддерживается | CentOS 7.y (где y ≤ 9) | |
Не поддерживается | CentOS 7.y (где y ≤ 9) |
Рисунок 2 Выбор параметров

Рисунок 3 Просмотр информации о драйвере

Рисунок 4 Получение ссылки

При перезапуске узла драйвер будет загружен и установлен повторно. Убедитесь, что ссылка OBS bucket драйвера действительна.
Component | Description | Resource Type |
|---|---|---|
nvidia-driver-installer | Рабочая нагрузка для установки драйвера NVIDIA GPU на узел, использующая ресурсы только во время установки (после установки она больше не использует ресурсы.) | DaemonSet |
nvidia-gpu-device-plugin | Плагин устройства Kubernetes, предоставляющий гетерогенные вычисления NVIDIA GPU для контейнеров | DaemonSet |
nvidia-operator | Компонент, предоставляющий возможности управления узлами NVIDIA GPU для кластеров | Deployment |