yandex

DevOps-инженер платформы запуска моделей

Разработка • От 3 до 6 лет • Гибрид

ОБЯЗАННОСТИ

  • участвовать в проектировании, развертывании и сопровождении сервисов платформы запуска моделей;
  • развивать и эксплуатировать Kubernetes-кластеры и базовые платформенные компоненты;
  • оценивать возможность применения готовых коммерческих и Open Source-решений;
  • формировать DevOps-подходы, выбирать инструменты и автоматизировать типовые операции;
  • разрабатывать и внедрять CI/CD-процессы для сборки, тестирования и развертывания сервисов;
  • интегрировать платформу с GitLab, реестрами образов, системами управления секретами и другими внутренними сервисами;
  • настраивать мониторинг, логирование, трассировку, алертинг и дашборды;
  • определять SLI/SLO сервисов и участвовать в повышении надежности платформы;
  • находить и устранять причины инцидентов, производительных деградаций и нестабильности;
  • проектировать высокодоступные решения, сценарии обновления, отката и аварийного восстановления;
  • автоматизировать проверку инфраструктурного кода, конфигураций и релизов;
  • адаптировать платформенные компоненты для поставки и эксплуатации в on-premise и изолированных средах;
  • готовить эксплуатационную документацию, runbook-сценарии и инструкции по диагностике;
  • согласовывать архитектурные и эксплуатационные решения с разработчиками, SRE, информационной безопасностью и командой частных инсталляций.

ТРЕБОВАНИЯ

  • глубокое знание Kubernetes и опыт эксплуатации production-кластеров;
  • хорошее понимание сетевой модели OSI, стека TCP/IP, DNS, балансировки и сетевого взаимодействия в Kubernetes;
  • опыт администрирования Unix-подобных операционных систем;
  • опыт автоматизации с использованием Bash и Python или Go;
  • понимание HTTP/HTTPS и опыт настройки web/reverse proxy-серверов;
  • практический опыт проектирования и внедрения CI/CD; - уверенное владение GitLab CI/CD или аналогичными инструментами;
  • опыт автоматизации инфраструктуры с помощью Ansible, Terraform и Helm;
  • опыт настройки систем мониторинга и логирования, например Prometheus, Grafana, Alertmanager, Loki или OpenSearch;
  • опыт работы с системами управления секретами, например HashiCorp Vault;
  • уверенное владение Git;
  • понимание принципов высокой доступности, отказоустойчивости и disaster recovery;
  • умение диагностировать проблемы распределенных систем на уровне приложения, Kubernetes, ОС и сети.

    Дополнительно:

  • опыт построения или эксплуатации GPU/HPC-кластеров;
  • знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;
  • опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;
  • опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;
  • опыт работы с OpenStack, KVM, VMware или аналогичными платформами;
  • опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;
  • понимание профиля нагрузки LLM inference и обучения моделей.

Подходит вакансия?

Оставь нам свое резюме и контактные данные

Не забудь прикрепить резюме файлом

.pdf.doc.docx