Анализировать загрузку GPU-кластера: находить причины простоя ресурсов, фрагментации нод, длительного ожидания задач и частых вытеснений нагрузки;
Собирать и формализовывать требования пользователей к аллокациям, очередям, приоритетам, гарантиям ресурсов и размещению задач;
Проектировать сценарии совместного использования ресурсов: закреплённые и эластичные аллокации, shared-нагрузка, заимствование свободной ёмкости и возврат ресурсов владельцу;
Исследовать и сравнивать подходы Kubernetes-, batch- и GPU-планировщиков, включая Volcano, Kueue, NVIDIA KAI Scheduler и Slurm;
Определять метрики эффективности планирования: утилизация, время ожидания, количество вытеснений, потерянные вычисления, доля заимствованных ресурсов и успешность запуска gang jobs;
Проверять предлагаемые алгоритмы на исторических данных, моделировать граничные сценарии и оценивать влияние изменений до запуска в production;
Готовить функциональные и нефункциональные требования, схемы процессов, RFC и постановки для команды разработки;
Сопровождать реализацию на всех этапах: от проработки решения и тестирования до поэтапного запуска и анализа результатов;
Работать с обратной связью пользователей, разбирать спорные сценарии распределения ресурсов и превращать их в прозрачные правила работы платформы.
ТРЕБОВАНИЯ
Опыт работы системным или продуктовым аналитиком в инфраструктурных, облачных либо платформенных командах;
Обладаете системным мышлением и умеете формализовывать сложные процессы с большим количеством ограничений и участников;
Понимаете основные принципы работы Kubernetes: nodes, pods, requests и limits, affinity, taints, priorities, queues и preemption;
Понимаете принципы планирования ресурсов: квоты, приоритеты, fairness, gang scheduling, bin packing и resource borrowing;
Умеете отделять физическое размещение нагрузки от её логического владельца, гарантированной квоты и временно заимствованных ресурсов;
Имеете опыт анализа метрик, событий и логов распределённых систем;
Умеете работать с SQL и одним из инструментов анализа данных, например Python;
Знакомы с Prometheus, Grafana и PromQL либо аналогичными инструментами мониторинга;
Умеете готовить техническую документацию и переводить пользовательские проблемы в требования, метрики и проверяемые гипотезы;
Способны аргументированно защищать предложения и эффективно взаимодействовать с разработчиками, архитекторами, владельцами платформы и пользовательскими командами;
Владеете английским языком на уровне чтения технической документации.
Будет плюсом:
Опыт работы с GPU- или ML-платформами;
Практический опыт использования Volcano, Kubernetes Kueue, NVIDIA KAI Scheduler, Slurm или аналогичных планировщиков;
Понимание особенностей gang jobs и распределённых ML-нагрузок;
Опыт разработки симуляторов, workload replay или capacity planning;
Знание Go и опыт чтения исходного кода Kubernetes-компонентов;
Опыт внедрения изменений через shadow mode, feature flags и canary rollout.
УСЛОВИЯ
Оформление в соответствии с трудовым законодательством РФ;
Конкурентный уровень дохода (оклад + годовой бонус);
ДМС со стоматологией и возможностью подключения к программе своих детей и родственников;
Прозрачную систему мотивации, которая позволяет влиять на уровень дохода;
Работу в команде профессионалов;
Участие в создании инновационных продуктов;
Гибкое начало рабочего дня, пятница - сокращенный рабочий день;
Возможность работать удаленно;
Офис в центре Москвы;
Корпоративную мобильную связь;
Льготную программу ипотечного и потребительского кредитования.
Еще у нас:
Возможность вертикального и горизонтального роста;
Бонусные программы от компаний партнеров;
Возможность получения бонуса за закрытие вакансии по вашей рекомендации;
Материальная помощь при рождении детей и др. семейных обстоятельствах;
Обучение в Корпоративном университете за счёт компании;
Участие в профильных конференциях в качестве спикера или слушателя;
Корпоративная жизнь: спортивные комьюнити, клубы по интересам (настолки, интеллектуальные игры).