Облачная платформаAdvanced

Как найти причину сбоя, когда кластер недоступен?

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

В этом разделе показано, как найти причину сбоя, когда кластер становится недоступным.

Устранение неполадок

Возможные причины перечислены в порядке вероятности.

Проверяйте эти причины одну за другой, пока не найдёте причину сбоя.

Если сбой сохраняется, обратитесь в службу поддержки, чтобы помочь вам найти причину сбоя.

Пункт проверки 1: Security Group Modification

  1. Войдите в консоль управления и выберите Service List > Networking > Virtual Private Cloud. В панели навигации выберите Access Control > Security Groups и найдите security group мастер‑узла в кластере.

    Имя этой security group имеет формат {cluster_name}-cce-control-{ID}.

  2. Нажмите security group. На отображённой странице деталей убедитесь, что правила security group мастер‑узла корректны.

    Подробности см. How Do I Modify Cluster Security Group Rules?

Пункт проверки 2: Cluster Overloaded

Симптом

Использование ресурсов на master nodes в кластере достигает 100%.

Возможная причина

Когда в кластере одновременно создаётся большое количество ресурсов, это приводит к перегрузке API server. Это, в свою очередь, перегружает master nodes и приводит к проблемам OOM.

Решение

Увеличьте масштаб управления кластером. Более крупный масштаб управления кластером означает большую ёмкость и повышенную производительность master nodes. Для получения подробной информации см. Changing a Cluster Scale.

Если кластер перегружен, вы можете отправить service ticket для получения технической поддержки.