Позиция предполагает сочетание продуктового и системного анализа с технической экспертизой в области ML/LLM-инференса.
Evolution ML Inference — платформа для автоматизированного развёртывания и эксплуатации ML-моделей в облаке, позволяющая запускать модели на GPU-инфраструктуре, управлять их конфигурацией, масштабированием и жизненным циклом.
Работа ориентирована на взаимодействие с кросс-командами, клиентами и разработчиками моделей, с глубоким погружением в то, как устроены развёртывание моделей, GPU-ресурсы, runtime, квоты, биллинг и эксплуатация inference-сервисов.
- Глубокое погружение в продукт и сценарии клиентов: анализ запросов, проработка и оптимизация решений совместно с продуктом и смежными командами (моделирование AS IS / TO BE);
- Управление полным циклом задачи: от сбора требований и постановки разработчикам до выкатки решения в ПРОД;
- Проектирование архитектурных и интеграционных решений: написание дизайн-документов, описание взаимодействия сервисов, создание и согласование спецификаций API (REST/gRPC);
- Проработка жизненного цикла inference-сервиса: создание, конфигурирование, запуск, остановка, изменение конфигурации, масштабирование, обновление и удаление;
- Проработка сценариев вывода новых моделей в каталог: сбор характеристик модели, требований к runtime и ресурсам, параметров запуска и ограничений, необходимых для её развёртывания и эксплуатации;
- Проработка конфигурации inference-сервисов: требования к GPU/CPU/RAM, количеству реплик, параметрам runtime, endpoint и другим параметрам, влияющим на производительность и стоимость;
- Проработка механизмов масштабирования и управления ресурсами: требования к autoscaling, лимитам, квотам, concurrency, RPS и другим ограничениям на использование inference-сервисов;
- Проработка учёта потребления и тарификации: требования к учёту использования GPU/CPU/RAM и других ресурсов, анализ корректности расчёта потребления и взаимодействия с биллинговыми системами;
- Анализ производительности и эксплуатационных характеристик моделей: latency, throughput, cold start, GPU utilization, потребление памяти и другие параметры, влияющие на качество работы и стоимость inference-сервисов;
- Анализ инцидентов и событий в кластере: разбор логов, метрик и событий Kubernetes, диагностика проблем с запуском, доступностью, масштабированием и производительностью inference-сервисов;
- Визуализация и документирование: построение процессных, архитектурных и sequence-диаграмм, использование нотаций UML и BPMN, поддержка внутренней документации по сервисам команды;
- Работа со смежными командами (биллинг, IAM, консоль) для построения E2E-сценариев и интеграций, координация зависимостей;
- Анализ данных и верификация гипотез с помощью SQL-запросов к базам данных, разбор инцидентов и обращений клиентов по логам и метрикам.