Облачная платформаEvolution

Что нового в сервисе ML Inference


История изменений сервиса ML Inference.

2026

Июль

Монтирование S3 в Docker RUN

Добавлена возможность работать с данными бакета S3 Object Storage в новых и ранее созданных инференсах Docker RUN.

Поддержка CUDA Graph Cache

Реализована возможность включения кеша CUDA Graph при создании и редактировании инференса Model RUN. Благодаря этому время запуска модели при масштабировании сокращается, а инференс сохраняет стабильную производительность при пиковой нагрузке.

Cron Scheduling

Добавлено cron-расписание для управления масштабированием моделей. По заданному расписанию система увеличивает или уменьшает количество GPU, позволяя заранее готовить ресурсы к ожидаемым нагрузкам и снижать затраты в периоды низкой активности.

Подробнее о масштабировании по cron-расписанию

Июнь

Маршрутизация запросов

Добавлена возможность использовать маршрутизаторы между сервисом Foundation Models и ML Inference. Маршрутизация запросов позволяет отслеживать нагрузку на модель и переключать трафик на инференс Model RUN при увеличении нагрузки.

Подробнее о маршрутизации запросов

Февраль

Добавлена поддержка Comfy RUN

Доступна интерактивная среда визуальной разработки Comfy для создания и настройки пайплайнов.

Comfy RUN позволяет описывать сложные сценарии обработки данных и взаимодействия моделей с помощью JSON-сценариев. Подходит для построения многоэтапных пайплайнов, интеграции различных моделей и автоматизации генерации изображений.

Подробнее о создании Comfy RUN

Public API

С помощью Public API можно:

  • получать список инференсов в проекте с поддержкой пагинации и фильтрации по названию инференса;

  • получать детальную информацию об инференсе, его возобновлении и приостановки;

  • управлять жизненным циклом инференсов, включая масштабирование, настройку ресурсов и параметров выполнения.

Подробнее о Public API в ML Inference

Январь

Аутентификация через API

Для взаимодействия с сервисом через API реализована аутентификация с помощью токена доступа или API-ключа.

Подробнее об аутентификации

2025

Сентябрь

Каталог моделей

Добавлен каталог моделей, готовых для запуска инференса. Теперь можно быстро начать работу без необходимости загружать и настраивать модели вручную. Для выбора доступны модели под задачи любой сложности, включая Qwen, DeepSeek, Gemma и другие.

Подробнее о запуске инференса на основе модели из каталога

Новые вычислительные ресурсы

Для запуска инференса моделей теперь доступна видеокарта NVIDIA A100 80GB SXM. Это позволяет работать с крупными моделями и увеличивает производительность при работе с высоконагруженными задачами.

Подробнее о доступных видеокартах

Тестовый вызов из OpenAPI

Реализована возможность отправки тестового вызова модели через OpenAPI. На вкладке Model RUN → OpenAPI доступна полная спецификация API, автоматически загружаемая с запущенного инстанса модели.

Теперь вы можете:

  • ознакомиться с описанием эндпоинтов, параметров, моделей, запросов и ответов;

  • протестировать вызовы напрямую через встроенный Swagger UI.

Подробнее о тестовом вызове модели из OpenAPI

Апрель

Сервис в General Availability

Сервис в общем доступе и тарифицируется согласно тарифам.

Запуск модели в Docker RUN

ML-модели теперь можно запускать в контейнере из пользовательского Docker-образа.

Поддержка технологии Shared GPU

Технология Shared GPU позволяет ML-моделям совместно использовать ресурсы графического ускорителя.

Поддержка новых библиотек

ML-инференс поддерживает библиотеки vLLM, TGI, Ollama, Diffusers, Transformers.