Существует несколько режимов работы с базовыми моделями ИИ для разных сценариев использования. Ниже приведены основные подходы и их особенности.
Приложение отправляет запрос и ожидает полного завершения операции перед продолжением работы.
Рекомендуется для:
простых скриптов и демонстраций;
сценариев с низкой нагрузкой;
последовательной обработки запросов.
Позволяет параллельно выполнять другие операции во время ожидания ответа от модели.
Преимущества:
оптимальное использование ресурсов;
поддержка высоконагруженных систем;
интеграция с веб-фреймворками (FastAPI, Django).
При работе с синхронным и асинхронным режимами учитывайте следующие ограничения:
лимит — 20 параллельных запросов на организацию;
таймауты управляются автоматически;
асинхронный режим требует поддержки цикла обработки событий (event loop) в вашей среде выполнения;
оба режима поддерживают настройку параметров temperature и max_tokens.