Во время развертывания сервиса или его работы вы можете инициировать операции с высоким риском на разных уровнях, вызывая сбои сервиса или его прерывание. Чтобы помочь вам более точно оценить и избежать рисков операций, в этом разделе представлены последствия и решения операций с высоким риском с различных точек зрения, таких как кластеры, узлы, сеть, балансировка нагрузки, логи и EVS disks.
Категория | Операция | Воздействие | Решение |
|---|---|---|---|
Кластер | Использование kube-apiserver для одновременного получения больших объёмов данных. Например, одновременно инициируется большое количество запросов LIST, либо один запрос LIST используется для получения большого объёма данных. | Память master node перегружена, что влияет на стабильность системы. | Прекратите выполнение большого количества запросов. Чтобы предотвратить перегрузку кластера, масштабируйте кластер. Подробности см. Changing a Cluster Scale. |
Master node | Изменение группы безопасности master nodes в кластере ПРИМЕЧАНИЕ: Правило именования группы безопасности master node: Cluster name-cce-control-{Random ID} | master nodes могут быть недоступны. | Восстановите группу безопасности, обратившись к «Creating a Cluster», и разрешите трафик от и к master nodes. |
Допускание истечения срока действия master node или его уничтожения | master node станет недоступен. | Эту операцию нельзя отменить. | |
Переустановка ОС | Компоненты master node будут удалены. | Эту операцию нельзя отменить. | |
Обновление компонентов master node или версии etcd | cluster может быть недоступен. | Откат к исходной версии. | |
Удаление или форматирование основных каталогов, таких как /etc/kubernetes на узле | master node станет недоступен. | Это действие нельзя отменить. | |
Изменение IP-адреса главного узла | Главный узел станет недоступным. | Верните IP-адрес к исходному. | |
Изменение параметров основных компонентов (например, etcd, kube-apiserver и Docker) | Главный узел может быть недоступен. | Восстановите параметры до рекомендуемых значений. Подробнее см. Modifying Cluster Configurations. | |
Замена главного узла или сертификата etcd | Кластер может быть недоступен. | Это действие нельзя отменить. | |
Рабочий узел | Изменение группы безопасности рабочих узлов в кластере ПРИМЕЧАНИЕ: Правило именования группы безопасности рабочего узла: Cluster name-cce-node-{Random ID} | Узел может быть недоступен. | Восстановите группу безопасности, руководствуясь "Creating a Cluster", и разрешите трафик от и к рабочим узлам. |
Изменение конфигурации DNS (/etc/resolv.conf) узла. | Внутренние доменные имена недоступны, и некоторые функции, такие как add-ons и in-place node upgrades, работают аномально. ПРИМЕЧАНИЕ: Если вашему сервису необходимо использовать локальный DNS, настройте DNS в рабочей нагрузке. Не изменяйте DNS‑адрес узла. Для получения подробной информации см. DNS Configuration. | Восстановите конфигурацию DNS на основе конфигурации DNS нового узла. | |
Удаление узла. | Узел станет недоступным. | Эту операцию нельзя отменить. | |
Удаление elastic network interface, используемого узлом. | Контейнерная сеть на узле недоступна. | Эту операцию нельзя отменить. | |
Переустановка ОС. | Компоненты узла удаляются, и узел становится недоступным. | Сбросьте узел. Для получения подробной информации см. Resetting a Node. | |
Обновление ядра или компонентов, от которых зависит платформа контейнеров (например Open vSwitch, IPvlan, Docker и containerd) | Узел может быть недоступен, а сеть может работать аномально. ПРИМЕЧАНИЕ: Работа узла зависит от версии системного ядра. Не используйте команду yum update для обновления или переустановки ядра узла, если это не необходимо. (Переустановка ядра операционной системы с использованием оригинального образа или других образов является рискованной операцией.) | Сбросьте узел. Подробности см. в Resetting a Node. | |
Изменение IP-адреса узла | Узел станет недоступным. | Верните IP-адрес к исходному. | |
Изменение параметров основных компонентов (например kubelet и kube-proxy) | Узел может стать недоступным, а компоненты могут стать небезопасными, если изменены конфигурации, связанные с безопасностью. Даже если после изменения перечисленные проблемы не возникнут, изменённые параметры могут быть сброшены при последующих обновлениях кластера. Подробности см. в Precautions. | Если узел становится недоступным, восстановите его до рекомендованных параметров. Подробности см. в Configuring a Node Pool. Измените конфигурации в консоли CCE, чтобы изменения автоматически наследовались при обновлениях кластера. | |
Изменение конфигурации ОС | Узел может быть недоступен. | Восстановите элементы конфигурации или сбросьте узел. Подробнее см. Resetting a Node. | |
Удаление или изменение каталогов /opt/cloud/cce и /var/paas, а также удаление диска с данными | Узел станет недоступным. | Сбросьте узел. Подробнее см. Resetting a Node. | |
Изменение прав доступа к каталогу узла и к каталогу контейнера. Затрагиваются следующие каталоги:
| Права доступа будут некорректными. | Не изменяйте права доступа. Восстановите права доступа, если они были изменены. | |
Formatting или разметка дисков на узле, включая системный диск и диски с данными, используемые средой выполнения контейнеров и kubelet. | Узел может стать недоступным. | Сбросьте узел. Подробнее см. Resetting a Node. | |
Установка другого программного обеспечения на узел | Это может вызвать исключения в компонентах Kubernetes, установленных на узле, и узел может стать недоступным. | Удалите программное обеспечение и восстановите или сбросьте узел. Подробнее см. Resetting a Node. | |
Изменение конфигураций NetworkManager | Узел станет недоступным. | Сбросьте узел. Подробнее см. Resetting a Node. | |
Удаление системных образов, таких как cce-pause, с узла | Контейнеры не могут быть созданы, а системные образы не могут быть получены. | Скопируйте образ с узла, который работает нормально. | |
Изменение Флейвора узла в пуле узлов в консоли ECS | Если Флейвор узла отличается от Флейвора, указанного в пуле узлов, где находится узел, увеличенное количество узлов при масштабировании пула узлов отличается от ожидаемого. | Измените Флейвор узла на указанный в пуле узлов, либо удалите узел и выполните масштабирование пула узлов повторно. | |
Удаление или перемещение бинарных и конфигурационных файлов, необходимых для работы containerd
| Если /usr/local/bin/crictl удалён, проверка состояния containerd будет аномальной, и containerd будет постоянно перезапускаться. Удаление других файлов может привести к сбою запуска контейнера и недоступности узла. | Сбросьте узел, чтобы восстановить бинарные и конфигурационные файлы для containerd. Подробнее см. Resetting a Node. | |
Изменение или ручное создание пользователя paas или группы пользователей | Работа компонентов CCE и сервисных pod‑ов будет затронута. Подробнее см. paas User and User Group. | Сбросьте узел. Подробнее см. Resetting a Node. |
Операция | Влияние | Решение |
|---|---|---|
Изменение значения параметра ядра net.ipv4.ip_forward на 0 | Сеть становится недоступной. | Измените значение на 1. |
Изменение значения параметра ядра net.ipv4.tcp_tw_recycle на 1 | Служба NAT работает аномально. | Измените значение на 0. |
Изменение значения параметра ядра net.ipv4.tcp_tw_reuse на 1 | Сеть работает аномально. | Измените значение на 0. |
Не настроена node security group для разрешения UDP-трафика к container CIDR blocks через порт 53 | DNS в кластере не может работать корректно. | Восстановите группу безопасности, ссылаясь на операции, предоставленные для a newly created cluster, и разрешите трафик к CIDR‑блокам контейнера. |
Удаление ресурсов CRD network-attachment-definitions в default-network. | Сеть контейнера отключена, либо кластер не может быть удалён. | Если ресурсы удалены по ошибке, используйте правильные конфигурации для создания ресурсов default-network. |
Включение iptables‑файрвола | По умолчанию iptables‑файрвол отключён в CCE. Включение файрвола может сделать сеть недоступной. ПРИМЕЧАНИЕ: Не включайте iptables‑файрвол. Если iptables‑файрвол необходимо включить, проверьте, повлияют ли правила, настроенные в /etc/sysconfig/iptables и /etc/sysconfig/ip6tables в тестовой среде, на сеть. | Отключите iptables‑файрвол и проверьте правила, настроенные в /etc/sysconfig/iptables и /etc/sysconfig/ip6tables. |
Операция | Влияние | Решение |
|---|---|---|
Настройка привилегированных контейнеров для рабочей нагрузки и прямое управление аппаратным обеспечением хоста. Возможны ошибочные операции с системными файлами узла. Например, если вы задаете команду запуска /usr/sbin/init и запускаете systemctl в контейнерах, системные файлы в каталоге /lib узла могут быть повреждены. | Все точки монтирования узла будут отмонтированы. В результате узел будет работать некорректно, что приведёт к сбоям pod‑ов и затронет функции дополнений хранилища. | Не удаляйте точки монтирования в каталоге /lib узла. Выполните сброс узла для восстановления. Подробности см. в разделе Resetting a Node. |
Монтирование каталога системного компонента с использованием hostPath, например, монтирование файлов в /var/lib/docker. | После перезапуска системного компонента каталог системного компонента на узле может быть восстановлен, что прерывает inode‑связь смонтированного каталога. В результате содержимое смонтированного каталога нельзя использовать в контейнере. | Не монтируйте каталог системного компонента. |
Operation | Impact | Solution |
|---|---|---|
Удаление load balancer, связанного с кластером CCE | Доступ к целевому Service или ingress завершится неудачей. | Не удаляйте такой load balancer. |
Отключение load balancer, связанного с кластером CCE | Доступ к целевому Service или ingress завершится неудачей. | Не отключайте такой load balancer. Если load balancer был отключён, включите его. |
Изменение частного IPv4-адреса load balancer. |
| Не меняйте частные IPv4-адреса load balancer'ов. Верните их обратно, если они были изменены. |
Отвязывание IPv4 EIP от load balancer. | После того как EIP будет отвязан от load balancer, load balancer не сможет перенаправлять трафик Internet. | Восстановите привязку EIP. |
Добавление listener к load balancer, связанному с CCE cluster. | Если load balancer автоматически создаётся при создании Service или ingress, любой listener, добавленный к load balancer в консоли ELB, не может быть удалён при удалении Service или ingress. В этом случае load balancer не может быть автоматически удалён. | Используйте listener, автоматически создаваемый при создании Service или ingress. Если используется listener, добавленный в консоли ELB, вручную удалите этот load balancer. |
Удаление listener, автоматически добавленного CCE. |
| Создайте заново или обновите Service или ingress. |
Изменение базовых конфигураций, таких как имя, контроль доступа, тайм‑аут или описание listener, добавленного CCE. | Когда master‑узлы перезапускаются по причинам, например, обновлению кластера, все ваши изменения будут сброшены CCE. | Не изменяйте базовые конфигурации listener, созданного CCE. Восстановите конфигурации, если они были изменены. |
Изменение backend server group listener, добавленного CCE, включая добавление или удаление backend server в/из группы серверов. |
| Создайте заново или обновите Service или ingress. |
Замена backend server group listener, добавленного CCE. |
| Создайте заново или обновите Service или ingress. |
Изменение forwarding policy listener, добавленного CCE, включая добавление или удаление forwarding rules. |
| Не изменяйте политику переадресации такого listener. Восстановите конфигурацию, если она была изменена. |
Замена сертификата listener, созданного CCE в консоли ELB, или изменение серверного сертификата, созданного CCE с использованием TLS key на странице Certificates ELB | В сценариях, когда необходимо перезапустить master node, например во время обновления кластера, изменение будет сброшено CCE. В результате Service или ingress может стать недоступным. | Используйте консоль CCE или YAML для обновления сертификата, связанного с Service или ingress, или обновите TLS key, связанный с Service или ingress. |
Операция | Влияние | Решение |
|---|---|---|
Удаление каталога /tmp/ccs-log-collector/pos на хост‑машине | Логи собираются повторно. | Нет |
Удаление каталога /tmp/ccs-log-collector/buffer на хост‑машине | Логи потеряны. | Нет |
Операция | Воздействие | Решение |
|---|---|---|
Настройка большего количества шардов сбора в Cloud Native Cluster Monitoring, чем рекомендованное значение (один шард сбора на 50 узлов) | Избыточное количество шардов может перегрузить память мастер‑узла, влияя на стабильность системы. | Измените количество шардов сбора до рекомендованного значения для Cloud Native Cluster Monitoring. |
Операция | Воздействие | Решение | Примечания |
|---|---|---|---|
Ручное размонтирование EVS диска в console | При записи данных в pod происходит ошибка I/O. | Удалите путь монтирования с node и запланируйте pod повторно. | Файл в pod фиксирует место, где следует собрать файлы. |
Размонтирование пути монтирования диска на node | Данные pod записываются на локальный диск. | Повторно смонтируйте соответствующий путь в pod. | Буфер содержит файлы кэша логов, которые необходимо потребить. |
Управление EVS дисками на node | Данные pod записываются на локальный диск. | None | None |
Создание PV с параметрами, которые не объявлены в файле Например, если YAML файл содержит параметры, такие как status, spec.claimRef и annotation.everest.io/set-disk-metadata при создании PV, PV может быть аномальным. | Эта операция может обходить некоторые стандартные процессы создания PV. В результате созданные PV могут стать недоступными или быть удалены неожиданно. | Перед удалением таких PV вручную удалите связанные параметры в их YAML‑файлах. | Нет |
Operation | Impact | Solution |
|---|---|---|
Изменение ресурсов add‑on в бэкенде | Могут возникнуть исключения add‑on или другие непредвиденные проблемы. Например, параметры настроек перезаписываются после обновления. | Выполняйте операции на странице конфигурации add‑on или используя open add‑on management APIs. |