yandex

DevOps-инженер вычислительной инфраструктуры

Разработка • От 3 до 6 лет • Гибрид

ОБЯЗАННОСТИ

  • участвовать в проектировании архитектуры вычислительных кластеров для AI-нагрузок;
  • автоматизировать подготовку, конфигурацию и жизненный цикл bare-metal-серверов;
  • развивать инфраструктуру виртуализации и процессы предоставления виртуальных машин;
  • развертывать и сопровождать Kubernetes-кластеры на физических и виртуальных узлах;
  • настраивать сетевую связность, сегментацию, маршрутизацию, балансировку и доступ к инфраструктурным сервисам;
  • интегрировать GPU и другие ускорители: драйверы, device plugins, операторы и средства мониторинга;
  • участвовать в проектировании и эксплуатации хранилищ для весов моделей, датасетов и кешей;
  • развивать Infrastructure as Code, GitOps и автоматизированные процессы изменения инфраструктуры;
  • создавать CI/CD-процессы для инфраструктурного кода, образов ОС и базовых компонентов кластеров;
  • настраивать мониторинг оборудования, сети, ОС, виртуализации, Kubernetes и ускорителей;
  • проводить capacity planning, анализировать утилизацию и находить инфраструктурные узкие места;
  • проектировать отказоустойчивость, резервирование и восстановление после сбоев;
  • стабилизировать платформу, участвовать в расследовании инцидентов и устранять их первопричины;
  • готовить типовые инфраструктурные конфигурации для облака и on-premise-инсталляций;
  • оценивать и внедрять подходящие Open Source и коммерческие инфраструктурные решения;
  • координировать изменения с владельцами дата-центров, сетей, информационной безопасности и продуктовыми командами.

ТРЕБОВАНИЯ

  • опыт эксплуатации Linux-инфраструктуры в production; - глубокое понимание модели OSI, TCP/IP, DNS, VLAN, маршрутизации и балансировки;
  • опыт работы с bare-metal-серверами и автоматизацией их подготовки;
  • опыт эксплуатации одной или нескольких платформ виртуализации;
  • уверенное знание Kubernetes и принципов устройства контейнерной инфраструктуры;
  • опыт написания скриптов и инструментов автоматизации на Bash, Python или Go;
  • опыт применения Ansible и Terraform либо аналогичных средств Infrastructure as Code;
  • практический опыт построения CI/CD для инфраструктурных изменений;
  • опыт настройки мониторинга оборудования, ОС и сетевых компонентов;
  • понимание принципов работы распределенных хранилищ и требований к производительности ввода-вывода;
  • опыт работы с Git и code review;
  • знание принципов высокой доступности, резервирования и disaster recovery;
  • системный подход к диагностике сложных инфраструктурных проблем.

Дополнительно:

  • опыт построения или эксплуатации GPU/HPC-кластеров;
  • знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;
  • опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;
  • опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;
  • опыт работы с OpenStack, KVM, VMware или аналогичными платформами;
  • опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;
  • понимание профиля нагрузки LLM inference и обучения моделей.

Подходит вакансия?

Оставь нам свое резюме и контактные данные

Не забудь прикрепить резюме файлом

.pdf.doc.docx