История изменений сервиса ML Inference.
Добавлена возможность работать с данными бакета S3 Object Storage в новых и ранее созданных инференсах Docker RUN.
Реализована возможность включения кеша CUDA Graph при создании и редактировании инференса Model RUN. Благодаря этому время запуска модели при масштабировании сокращается, а инференс сохраняет стабильную производительность при пиковой нагрузке.
Добавлено cron-расписание для управления масштабированием моделей. По заданному расписанию система увеличивает или уменьшает количество GPU, позволяя заранее готовить ресурсы к ожидаемым нагрузкам и снижать затраты в периоды низкой активности.
Добавлена возможность использовать маршрутизаторы между сервисом Foundation Models и ML Inference. Маршрутизация запросов позволяет отслеживать нагрузку на модель и переключать трафик на инференс Model RUN при увеличении нагрузки.
Доступна интерактивная среда визуальной разработки Comfy для создания и настройки пайплайнов.
Comfy RUN позволяет описывать сложные сценарии обработки данных и взаимодействия моделей с помощью JSON-сценариев. Подходит для построения многоэтапных пайплайнов, интеграции различных моделей и автоматизации генерации изображений.
С помощью Public API можно:
получать список инференсов в проекте с поддержкой пагинации и фильтрации по названию инференса;
получать детальную информацию об инференсе, его возобновлении и приостановки;
управлять жизненным циклом инференсов, включая масштабирование, настройку ресурсов и параметров выполнения.
Для взаимодействия с сервисом через API реализована аутентификация с помощью токена доступа или API-ключа.
Добавлен каталог моделей, готовых для запуска инференса. Теперь можно быстро начать работу без необходимости загружать и настраивать модели вручную. Для выбора доступны модели под задачи любой сложности, включая Qwen, DeepSeek, Gemma и другие.
Для запуска инференса моделей теперь доступна видеокарта NVIDIA A100 80GB SXM. Это позволяет работать с крупными моделями и увеличивает производительность при работе с высоконагруженными задачами.
Реализована возможность отправки тестового вызова модели через OpenAPI. На вкладке Model RUN → OpenAPI доступна полная спецификация API, автоматически загружаемая с запущенного инстанса модели.
Теперь вы можете:
ознакомиться с описанием эндпоинтов, параметров, моделей, запросов и ответов;
протестировать вызовы напрямую через встроенный Swagger UI.
Сервис в общем доступе и тарифицируется согласно тарифам.
ML-модели теперь можно запускать в контейнере из пользовательского Docker-образа.
Технология Shared GPU позволяет ML-моделям совместно использовать ресурсы графического ускорителя.
ML-инференс поддерживает библиотеки vLLM, TGI, Ollama, Diffusers, Transformers.