Оказывать углублённую техническую поддержку клиентам по вопросам эксплуатации облачных продуктов и сервисов.
Разбираться в архитектуре клиентских решений, особенностях их инфраструктуры, интеграций, конфигураций и сценариев использования.
Принимать в работу сложные технические обращения и инциденты, переданные с линии L2.
Проводить диагностику, локализовывать причины неисправностей и восстанавливать работоспособность сервисов.
Самостоятельно воспроизводить проблемы, анализировать логи, метрики, трассировки, сетевое взаимодействие и конфигурацию компонентов.
Участвовать в обработке критических инцидентов и технически координировать подключение необходимых команд разработки, эксплуатации, SRE и продукта.
Обеспечивать техническую коммуникацию с клиентом в рамках инцидента: запрашивать необходимые данные, сообщать результаты диагностики, ограничения, обходные решения и дальнейшие действия.
Помогать инженерным командам в расследовании проблем, предоставляя контекст клиентской инфраструктуры, историю изменений и сведения об аналогичных инцидентах.
Участвовать в проведении RCA и подготовке технической части post‑mortem по значимым и повторяющимся инцидентам.
Контролировать выполнение технических корректирующих мероприятий, направленных на предотвращение повторных сбоев.
Проактивно выявлять технические риски в конфигурации и эксплуатации клиентских решений и формировать рекомендации по их устранению.
Совместно с командами SRE и разработки повышать надёжность сервисов: улучшать мониторинг, алертинг, диагностируемость и эксплуатационные процедуры.
Автоматизировать типовые операции диагностики, восстановления и сопровождения.
Создавать и поддерживать техническую документацию, инструкции, run‑book и материалы для инженеров L1/L2/L3.
Передавать в продуктовые и инженерные команды технически обоснованные предложения по устранению дефектов и улучшению эксплуатационных характеристик продукта.
ТРЕБОВАНИЯ
Уверенные знания Linux и опыт администрирования производственных систем.
Практический опыт работы с контейнерами и Kubernetes: диагностика workload, networking, storage, control plane и системных компонентов.
Опыт сопровождения критичных информационных систем и инфраструктуры.
Навыки системного поиска причин неисправностей и принятия решений в условиях критических инцидентов.
Опыт работы с системами мониторинга, логирования и трассировки: Prometheus, Grafana, ELK/OpenSearch, Zabbix или аналогами.
Опыт работы с Git и CI/CD‑системами.
Опыт автоматизации с использованием Bash или Python.
Опыт работы с Ansible, Terraform или другими инструментами управления конфигурацией будет преимуществом.
Для инфраструктурного направления — знание OpenStack и его основных компонентов: Nova, Cinder, Glance, Neutron/OVN.
Умение понятно обсуждать технические вопросы с клиентскими и внутренними инженерными командами без ухода в функции аккаунтинга и управления отношениями.
УСЛОВИЯ
Оформление в соответствии с трудовым законодательством РФ.
Конкурентный уровень дохода (оклад + годовой бонус).
ДМС со стоматологией и возможностью подключения к программе своих детей и родственников.
Прозрачную систему мотивации, которая позволяет влиять на уровень дохода.
Работу в команде профессионалов.
Участие в создании инновационных продуктов.
Гибкое начало рабочего дня, пятница — сокращённый рабочий день.
Офис в центре Москвы.
Корпоративную мобильную связь.
Льготную программу ипотечного и потребительского кредитования.
Ещё у нас:
Возможность вертикального и горизонтального роста.
Бонусные программы от компаний‑партнёров.
Возможность получения бонуса за закрытие вакансии по вашей рекомендации.
Материальная помощь при рождении детей и других семейных обстоятельствах.
Обучение в Корпоративном университете за счёт компании.
Участие в профильных конференциях в качестве спикера или слушателя.
Корпоративная жизнь: спортивные комьюнити, клубы по интересам (настолки, интеллектуальные игры).