Облачная платформаAdvanced

Операции с высоким риском

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

Во время развертывания сервиса или его работы вы можете инициировать операции с высоким риском на разных уровнях, вызывая сбои сервиса или его прерывание. Чтобы помочь вам более точно оценить и избежать рисков операций, в этом разделе представлены последствия и решения операций с высоким риском с различных точек зрения, таких как кластеры, узлы, сеть, балансировка нагрузки, логи и EVS disks.

Кластеры и узлы

Table 1 Операции с высоким риском и решения

Категория

Операция

Воздействие

Решение

Кластер

Использование kube-apiserver для одновременного получения больших объёмов данных. Например, одновременно инициируется большое количество запросов LIST, либо один запрос LIST используется для получения большого объёма данных.

Память master node перегружена, что влияет на стабильность системы.

Прекратите выполнение большого количества запросов.

Чтобы предотвратить перегрузку кластера, масштабируйте кластер. Подробности см. Changing a Cluster Scale.

Master node

Изменение группы безопасности master nodes в кластере

ПРИМЕЧАНИЕ:

Правило именования группы безопасности master node: Cluster name-cce-control-{Random ID}

master nodes могут быть недоступны.

Восстановите группу безопасности, обратившись к «Creating a Cluster», и разрешите трафик от и к master nodes.

Допускание истечения срока действия master node или его уничтожения

master node станет недоступен.

Эту операцию нельзя отменить.

Переустановка ОС

Компоненты master node будут удалены.

Эту операцию нельзя отменить.

Обновление компонентов master node или версии etcd

cluster может быть недоступен.

Откат к исходной версии.

Удаление или форматирование основных каталогов, таких как /etc/kubernetes на узле

master node станет недоступен.

Это действие нельзя отменить.

Изменение IP-адреса главного узла

Главный узел станет недоступным.

Верните IP-адрес к исходному.

Изменение параметров основных компонентов (например, etcd, kube-apiserver и Docker)

Главный узел может быть недоступен.

Восстановите параметры до рекомендуемых значений. Подробнее см. Modifying Cluster Configurations.

Замена главного узла или сертификата etcd

Кластер может быть недоступен.

Это действие нельзя отменить.

Рабочий узел

Изменение группы безопасности рабочих узлов в кластере

ПРИМЕЧАНИЕ:

Правило именования группы безопасности рабочего узла: Cluster name-cce-node-{Random ID}

Узел может быть недоступен.

Восстановите группу безопасности, руководствуясь "Creating a Cluster", и разрешите трафик от и к рабочим узлам.

Изменение конфигурации DNS (/etc/resolv.conf) узла.

Внутренние доменные имена недоступны, и некоторые функции, такие как add-ons и in-place node upgrades, работают аномально.

ПРИМЕЧАНИЕ:

Если вашему сервису необходимо использовать локальный DNS, настройте DNS в рабочей нагрузке. Не изменяйте DNS‑адрес узла. Для получения подробной информации см. DNS Configuration.

Восстановите конфигурацию DNS на основе конфигурации DNS нового узла.

Удаление узла.

Узел станет недоступным.

Эту операцию нельзя отменить.

Удаление elastic network interface, используемого узлом.

Контейнерная сеть на узле недоступна.

Эту операцию нельзя отменить.

Переустановка ОС.

Компоненты узла удаляются, и узел становится недоступным.

Сбросьте узел. Для получения подробной информации см. Resetting a Node.

Обновление ядра или компонентов, от которых зависит платформа контейнеров (например Open vSwitch, IPvlan, Docker и containerd)

Узел может быть недоступен, а сеть может работать аномально.

ПРИМЕЧАНИЕ:

Работа узла зависит от версии системного ядра. Не используйте команду yum update для обновления или переустановки ядра узла, если это не необходимо. (Переустановка ядра операционной системы с использованием оригинального образа или других образов является рискованной операцией.)

Сбросьте узел. Подробности см. в Resetting a Node.

Изменение IP-адреса узла

Узел станет недоступным.

Верните IP-адрес к исходному.

Изменение параметров основных компонентов (например kubelet и kube-proxy)

Узел может стать недоступным, а компоненты могут стать небезопасными, если изменены конфигурации, связанные с безопасностью.

Даже если после изменения перечисленные проблемы не возникнут, изменённые параметры могут быть сброшены при последующих обновлениях кластера. Подробности см. в Precautions.

Если узел становится недоступным, восстановите его до рекомендованных параметров. Подробности см. в Configuring a Node Pool.

Измените конфигурации в консоли CCE, чтобы изменения автоматически наследовались при обновлениях кластера.

Изменение конфигурации ОС

Узел может быть недоступен.

Восстановите элементы конфигурации или сбросьте узел. Подробнее см. Resetting a Node.

Удаление или изменение каталогов /opt/cloud/cce и /var/paas, а также удаление диска с данными

Узел станет недоступным.

Сбросьте узел. Подробнее см. Resetting a Node.

Изменение прав доступа к каталогу узла и к каталогу контейнера. Затрагиваются следующие каталоги:

/usr/lib/systemd/system/kubelet.service
/usr/lib/systemd/system/containerd-monit.service
/usr/lib/systemd/system/docker-monit.service
/opt/cloud/cce
/var/paas
/var/paas/script
/var/paas/sys/log
/var/paas/kubernetes
/var/script/docker
/var/script/kubelet
/etc/containerd
/etc/rc.local
/etc/sudoers.d/sudoerspaas
/etc/sysconfig/docker
/etc/docker/daemon.json
/var/lib/docker
/mnt/paas/kubernetes
/mnt/paas/runtime

Права доступа будут некорректными.

Не изменяйте права доступа. Восстановите права доступа, если они были изменены.

Formatting или разметка дисков на узле, включая системный диск и диски с данными, используемые средой выполнения контейнеров и kubelet.

Узел может стать недоступным.

Сбросьте узел. Подробнее см. Resetting a Node.

Установка другого программного обеспечения на узел

Это может вызвать исключения в компонентах Kubernetes, установленных на узле, и узел может стать недоступным.

Удалите программное обеспечение и восстановите или сбросьте узел. Подробнее см. Resetting a Node.

Изменение конфигураций NetworkManager

Узел станет недоступным.

Сбросьте узел. Подробнее см. Resetting a Node.

Удаление системных образов, таких как cce-pause, с узла

Контейнеры не могут быть созданы, а системные образы не могут быть получены.

Скопируйте образ с узла, который работает нормально.

Изменение Флейвора узла в пуле узлов в консоли ECS

Если Флейвор узла отличается от Флейвора, указанного в пуле узлов, где находится узел, увеличенное количество узлов при масштабировании пула узлов отличается от ожидаемого.

Измените Флейвор узла на указанный в пуле узлов, либо удалите узел и выполните масштабирование пула узлов повторно.

Удаление или перемещение бинарных и конфигурационных файлов, необходимых для работы containerd

/etc/containerd/config.toml
/etc/crictl.yaml
/usr/bin/runc
/usr/lib/systemd/system/containerd.service
/usr/local/bin/containerd
/usr/local/bin/containerd-shim-runc-v2
/usr/local/bin/crictl
/usr/local/bin/ctr

Если /usr/local/bin/crictl удалён, проверка состояния containerd будет аномальной, и containerd будет постоянно перезапускаться.

Удаление других файлов может привести к сбою запуска контейнера и недоступности узла.

Сбросьте узел, чтобы восстановить бинарные и конфигурационные файлы для containerd. Подробнее см. Resetting a Node.

Изменение или ручное создание пользователя paas или группы пользователей

Работа компонентов CCE и сервисных pod‑ов будет затронута. Подробнее см. paas User and User Group.

Сбросьте узел. Подробнее см. Resetting a Node.

Сеть

Таблица 2 Сеть

Операция

Влияние

Решение

Изменение значения параметра ядра net.ipv4.ip_forward на 0

Сеть становится недоступной.

Измените значение на 1.

Изменение значения параметра ядра net.ipv4.tcp_tw_recycle на 1

Служба NAT работает аномально.

Измените значение на 0.

Изменение значения параметра ядра net.ipv4.tcp_tw_reuse на 1

Сеть работает аномально.

Измените значение на 0.

Не настроена node security group для разрешения UDP-трафика к container CIDR blocks через порт 53

DNS в кластере не может работать корректно.

Восстановите группу безопасности, ссылаясь на операции, предоставленные для a newly created cluster, и разрешите трафик к CIDR‑блокам контейнера.

Удаление ресурсов CRD network-attachment-definitions в default-network.

Сеть контейнера отключена, либо кластер не может быть удалён.

Если ресурсы удалены по ошибке, используйте правильные конфигурации для создания ресурсов default-network.

Включение iptables‑файрвола

По умолчанию iptables‑файрвол отключён в CCE. Включение файрвола может сделать сеть недоступной.

ПРИМЕЧАНИЕ:

Не включайте iptables‑файрвол. Если iptables‑файрвол необходимо включить, проверьте, повлияют ли правила, настроенные в /etc/sysconfig/iptables и /etc/sysconfig/ip6tables в тестовой среде, на сеть.

Отключите iptables‑файрвол и проверьте правила, настроенные в /etc/sysconfig/iptables и /etc/sysconfig/ip6tables.

Контейнеры

Table 3 Контейнеры

Операция

Влияние

Решение

Настройка привилегированных контейнеров для рабочей нагрузки и прямое управление аппаратным обеспечением хоста. Возможны ошибочные операции с системными файлами узла.

Например, если вы задаете команду запуска /usr/sbin/init и запускаете systemctl в контейнерах, системные файлы в каталоге /lib узла могут быть повреждены.

Все точки монтирования узла будут отмонтированы. В результате узел будет работать некорректно, что приведёт к сбоям pod‑ов и затронет функции дополнений хранилища.

Не удаляйте точки монтирования в каталоге /lib узла. Выполните сброс узла для восстановления. Подробности см. в разделе Resetting a Node.

Монтирование каталога системного компонента с использованием hostPath, например, монтирование файлов в /var/lib/docker.

После перезапуска системного компонента каталог системного компонента на узле может быть восстановлен, что прерывает inode‑связь смонтированного каталога. В результате содержимое смонтированного каталога нельзя использовать в контейнере.

Не монтируйте каталог системного компонента.

Балансировка нагрузки

Table 4 Балансировка нагрузки

Operation

Impact

Solution

Удаление load balancer, связанного с кластером CCE

Доступ к целевому Service или ingress завершится неудачей.

Не удаляйте такой load balancer.

Отключение load balancer, связанного с кластером CCE

Доступ к целевому Service или ingress завершится неудачей.

Не отключайте такой load balancer. Если load balancer был отключён, включите его.

Изменение частного IPv4-адреса load balancer.

  • Трафик сети, перенаправляемый с использованием частных IPv4-адресов, будет прерван.
  • IP-адреса в поле status файлов Service или ingress YAML будут изменены.

Не меняйте частные IPv4-адреса load balancer'ов. Верните их обратно, если они были изменены.

Отвязывание IPv4 EIP от load balancer.

После того как EIP будет отвязан от load balancer, load balancer не сможет перенаправлять трафик Internet.

Восстановите привязку EIP.

Добавление listener к load balancer, связанному с CCE cluster.

Если load balancer автоматически создаётся при создании Service или ingress, любой listener, добавленный к load balancer в консоли ELB, не может быть удалён при удалении Service или ingress. В этом случае load balancer не может быть автоматически удалён.

Используйте listener, автоматически создаваемый при создании Service или ingress. Если используется listener, добавленный в консоли ELB, вручную удалите этот load balancer.

Удаление listener, автоматически добавленного CCE.

  • Доступ к целевому Service или ingress завершится неудачей.
  • При перезапуске master‑узлов по причинам, таким как обновление кластера, все ваши изменения будут сброшены CCE.

Создайте заново или обновите Service или ingress.

Изменение базовых конфигураций, таких как имя, контроль доступа, тайм‑аут или описание listener, добавленного CCE.

Когда master‑узлы перезапускаются по причинам, например, обновлению кластера, все ваши изменения будут сброшены CCE.

Не изменяйте базовые конфигурации listener, созданного CCE. Восстановите конфигурации, если они были изменены.

Изменение backend server group listener, добавленного CCE, включая добавление или удаление backend server в/из группы серверов.

  • Доступ к целевому Service или ingress завершится неудачей.
  • Когда master‑узлы перезапускаются по причинам, например, обновлению кластера, все ваши изменения будут сброшены CCE.
    • Удалённые backend server будут восстановлены.
    • Добавленные backend server будут удалены.

Создайте заново или обновите Service или ingress.

Замена backend server group listener, добавленного CCE.

  • Доступ к целевому Service или ingress завершится неудачей.
  • После перезапуска master‑узлов по причинам, например, обновлению кластера, все серверы в backend server group будут сброшены CCE.

Создайте заново или обновите Service или ingress.

Изменение forwarding policy listener, добавленного CCE, включая добавление или удаление forwarding rules.

  • Доступ к целевому Service или ingress будет невозможен.
  • После перезапуска master nodes по причинам, таким как обновление кластера, все ваши изменения будут сброшены CCE, если правила переадресации добавлены с помощью ingress.

Не изменяйте политику переадресации такого listener. Восстановите конфигурацию, если она была изменена.

Замена сертификата listener, созданного CCE в консоли ELB, или изменение серверного сертификата, созданного CCE с использованием TLS key на странице Certificates ELB

В сценариях, когда необходимо перезапустить master node, например во время обновления кластера, изменение будет сброшено CCE. В результате Service или ingress может стать недоступным.

Используйте консоль CCE или YAML для обновления сертификата, связанного с Service или ingress, или обновите TLS key, связанный с Service или ingress.

Логи

Table 5 Логи

Операция

Влияние

Решение

Удаление каталога /tmp/ccs-log-collector/pos на хост‑машине

Логи собираются повторно.

Нет

Удаление каталога /tmp/ccs-log-collector/buffer на хост‑машине

Логи потеряны.

Нет

Мониторинг

Table 6 Мониторинг

Операция

Воздействие

Решение

Настройка большего количества шардов сбора в Cloud Native Cluster Monitoring, чем рекомендованное значение (один шард сбора на 50 узлов)

Избыточное количество шардов может перегрузить память мастер‑узла, влияя на стабильность системы.

Измените количество шардов сбора до рекомендованного значения для Cloud Native Cluster Monitoring.

EVS диски

Table 7 EVS диски

Операция

Воздействие

Решение

Примечания

Ручное размонтирование EVS диска в console

При записи данных в pod происходит ошибка I/O.

Удалите путь монтирования с node и запланируйте pod повторно.

Файл в pod фиксирует место, где следует собрать файлы.

Размонтирование пути монтирования диска на node

Данные pod записываются на локальный диск.

Повторно смонтируйте соответствующий путь в pod.

Буфер содержит файлы кэша логов, которые необходимо потребить.

Управление EVS дисками на node

Данные pod записываются на локальный диск.

None

None

Создание PV с параметрами, которые не объявлены в файле

Например, если YAML файл содержит параметры, такие как status, spec.claimRef и annotation.everest.io/set-disk-metadata при создании PV, PV может быть аномальным.

Эта операция может обходить некоторые стандартные процессы создания PV. В результате созданные PV могут стать недоступными или быть удалены неожиданно.

Перед удалением таких PV вручную удалите связанные параметры в их YAML‑файлах.

Нет

Add-ons

Таблица 8 Add-ons

Operation

Impact

Solution

Изменение ресурсов add‑on в бэкенде

Могут возникнуть исключения add‑on или другие непредвиденные проблемы. Например, параметры настроек перезаписываются после обновления.

Выполняйте операции на странице конфигурации add‑on или используя open add‑on management APIs.