Локальный или облачный ИИ-агент: какой вариант выбрать для бизнеса
ИИ-агент для бизнеса — это не просто чат-бот, который отвечает на вопросы. Он может работать с корпоративными данными и документами, обращаться к внешним сервисам и выполнять действия по заданным правилам. Поэтому важно заранее решить, где его запускать: в инфраструктуре компании (on-premise), в облаке или в гибридной среде.

- Что такое ИИ-агент и чем он отличается от ИИ-ассистента
- Локальный ИИ-агент: когда данные не покидают контур
- Облачный ИИ-агент: скорость запуска и доступ к актуальным моделям
- Гибридная архитектура: как совместить оба подхода
- Сравнение вариантов по семи критериям
- Как Cloud.ru закрывает оба сценария
- Чек-лист: 8 вопросов перед выбором архитектуры
У каждого варианта свои преимущества и ограничения. Локальный ИИ-агент дает больше контроля над инфраструктурой и данными, облачный проще масштабировать и быстрее запускать, а гибридный позволяет сочетать оба подхода. Выбор зависит от задач бизнеса, требований к безопасности, характера нагрузки, стоимости и доступных ресурсов.
Разберем, чем отличаются локальные и облачные ИИ-агенты, сравним их по ключевым критериям и расскажем, когда имеет смысл использовать гибридную архитектуру.

Что такое ИИ-агент и чем он отличается от ИИ-ассистента
Главное отличие — в уровне автономности и способности воспринимать среду. ИИ-агент — это интеллектуальная система, которая:
самостоятельно воспринимает внешнюю среду (через MCP-серверы и API);
анализирует результаты своих действий;
принимает решения на основе данных и знаний;
планирует многошаговые действия для достижения цели;
выполняет операции без постоянного контроля человека.
Если ИИ-ассистент работает по принципу «запрос → ответ» и не инициирует действия самостоятельно, то агент получает общую цель, разбивает ее на подзадачи и корректирует план по мере необходимости.
Агент планирует, вызывает инструменты и действует в системах — ассистент только отвечает
ИИ-ассистент работает реактивно — он реагирует на запрос, анализирует информацию, отвечает или предлагает решения. Он не обладает автономностью для самостоятельного планирования действий. Если требуется продолжение, пользователь дает новые инструкции.
Агент действует иначе. Он получает цель, выстраивает цепочку шагов для ее достижения, разбивает задачу на этапы, выбирает инструменты, получает данные из внешних систем, обрабатывает и выполняет операции. Постоянные инструкции от пользователя ему не нужны.
Пример — сотрудник запрашивает у ИИ-ассистента отчет о работе отдела и дает свежие данные. Тот анализирует информацию и готовит документ. Для агента достаточно цели. Он сам найдет нужные источники и инструменты, соберет и обработает данные, сформирует отчет и передаст сотруднику. Если отдельные действия потребуют согласования, агент запросит подтверждение у человека.
Уровень автономности агента зависит от настроек. Для критичных действий вроде согласования платежей, отправки писем или изменения данных можно назначить обязательное подтверждение сотрудником.
Из чего состоит корпоративный агент: модель, память, RAG, инструменты, оркестратор
«Мозг» агента — большая языковая модель (LLM), поверх которой строится прикладная логика. Ее составляющие:
Строение корпоративного агентаПамять — позволяет ИИ-агенту сохранять контекст из предыдущих взаимодействий и в дальнейшем учитывать его. Это избавляет от необходимости постоянно давать одни и те же вводные.
RAG (Retrieval Augmented Generation) — дает модели возможность перед ответом получить данные из релевантных источников. Например, сотрудник спрашивает о правилах подготовки бухгалтерского отчета. Агент ищет в корпоративных регламентах информацию и выдает ответ, подкрепленный фактами.
Инструменты реализуются через MCP-серверы (Model Context Protocol) — специализированные компоненты, которые обеспечивают интеграцию агента с внешними источниками данных и системами. MCP-серверы открывают доступ к CRM, ERP, ITSM, базам данных, API и позволяют агенту совершать действия, получать данные и возвращать результаты. Благодаря MCP-протоколу агент может подключать новые инструменты без изменения основной логики.
Оркестрация агентов — оркестратор определяет последовательность действий, инициирует вызов инструментов, контролирует переход к следующему шагу или завершение задачи.
Эти компоненты делают из обычной LLM полноценного ИИ-агента, который будет приносить бизнесу реальную пользу.

Локальный ИИ-агент: когда данные не покидают контур
При локальном развертывании ИИ-агент и все его компоненты работают в инфраструктуре компании: собственном дата-центре, private cloud (частном облаке) или выделенном контуре. Это решение подходит для обработки информации, которая не должна покидать организацию: коммерческая тайна, персональные данные, техническая документация.
Как развернуть ИИ локально
Такое развертывание сводится не только к покупке «железа» — GPU-сервера. Помимо него нужны:
источники бесперебойного питания;
сетевое оборудование (коммутатор, выделенный DMZ-шлюз);
система хранения для моделей, документов и логов;
система резервного копирования данных;
резервные каналы связи;
средства журналирования и мониторинга для контроля действий агента.
В TCO (Total Cost of Ownership, совокупная стоимость владения) закладываются работы по настройке. Это интеграция с CRM, ERP, ITSM, корпоративными базами данных и другими внутренними системами, подключение API и источников данных, разграничение доступа агента, изоляция компонентов.
Учитываются и эксплуатационные затраты на обновление ПО и моделей, обслуживание локальных серверов ИИ, мониторинг, резервное копирование, информационную безопасность, электропитание и охлаждение оборудования.
Преимущества локального подхода
Главное — контроль над своими данными. Информация не уходит на сторонние серверы, а значит, снижаются риски утечки. Другие плюсы:
Кастомизация. Можно настраивать модель под специфику и нужды компании, дообучать на своих данных.
Стабильность. ИИ-агент будет работать по заданным настройкам, поскольку сторонние обновления на него не влияют.
Автономность. Можно не бояться блокировок со стороны провайдера, санкций, сбоев в работе внешних серверов.
Предсказуемая задержка. Время ответа модели зависит только от мощности оборудования.
ИИ в контуре компании также дает возможность настроить архитектуру под конкретные требования к сетевой изоляции и интеграции с внутренними системами.
Ограничения
Локальный ИИ-агент оправдан не всегда. Основные подводные камни:
Капитальные затраты. Компания самостоятельно приобретает GPU, организует хранение данных, обеспечивает резервирование, обновляет ПО.
Потребность в команде сопровождения. Нужны CIO, архитекторы решений, MLOps-инженеры, служба ИБ.
Отставание моделей от облачных. Автоматических обновлений не будет — компании придется отдельно их внедрять и тестировать.
Сложное масштабирование. Если нагрузка со временем вырастет, вычислительные ресурсы придется расширять самостоятельно.
Получается, что этот сценарий выигрывает только там, где на первом месте автономность и безопасность данных.
Облачный ИИ-агент: скорость запуска и доступ к актуальным моделям
Для использования такой системы не нужно закупать и обслуживать GPU-инфраструктуру — мощности арендуются у провайдера. Например, в AI Factory от Cloud.ru есть сервисы Evolution AI Agents для создания и эксплуатации автономных агентных решений, Evolution Foundation Models для доступа к готовым ИИ-моделям через API.
Оплата за токены и GPU-часы вместо закупки железа
При использовании LLM в облаке компания платит за фактически потребляемые ресурсы. Для готовых решений тарифы могут рассчитываться по входным и генерируемым токенам. Для созданных самостоятельно — по используемым мощностям. Это меняет структуру TCO — вместо капитальных затрат будут операционные расходы.
Что проверить у провайдера
Безопасность облачных ИИ-агентов строится на модели разделенной ответственности (Shared Responsibility Model):
Провайдер отвечает за: физическую безопасность дата-центров, сетевую инфраструктуру, изоляцию клиентов в общей инфраструктуре, шифрование данных на дисках, соответствие регуляторным требованиям.
Компания-клиент отвечает за: управление доступом и правами агента, классификацию данных, настройку политик безопасности, мониторинг действий агента и журналирование операций.
При выборе провайдера важно проверять не только его заверения, но и наличие технической документации, сертификатов и результатов независимых аудитов.
Даже если провайдер давно на рынке и имеет репутацию надежного, все равно проверьте:
где и как физически хранится информация;
как используются полученные данные и кому могут передаваться;
что будет с информацией, когда облачный сервер для ИИ перестанет использоваться;
применяются ли данные бизнеса для обучения моделей;
как организованы шифрование и защита;
проводятся ли независимые аудиты и тестирования безопасности;
как устроена изоляция клиентов в общей инфраструктуре;
как провайдер реагирует на инциденты ИБ.
Меры должны существовать не только на словах, а подтверждаться технической документацией и результатами проверок в части ИБ.
Когда облако проигрывает
Облачный ИИ-агент удобен гибкостью и возможностью при необходимости масштабировать или урезать вычислительные ресурсы. Однако для некоторых enterprise-сценариев он не дает контроля над данными, предсказуемых затрат и производительности. Когда предпочтительнее локальное размещение:
Постоянная высокая нагрузка. Если корпоративный ИИ-ассистент работает с большим потоком запросов, аренда вычислительных ресурсов может в перспективе обойтись дороже развертывания собственной инфраструктуры.
Нужна жесткая изоляция. Если в компании строгие политики безопасности, полностью переложить ответственность за данные на провайдера не получится. Разумнее оставить информацию и операции в корпоративном контуре.
Критичны даже минимальные задержки. При локальном размещении запросы обрабатываются внутри корпоративной инфраструктуры, поэтому задержка минимальна. Гибридный вариант тоже позволяет сократить latency: в облако передается только необходимый контекст, а чувствительные данные можно защитить с помощью Guardrails.
При таких вводных преимуществ LLM в облаке будет недостаточно для постоянной эксплуатации этого сценария.
Расчет TCO на примере: 5 млн токенов в месяц
Представим, что три миллиона токенов приходится на входные, два — на генерируемые. Стоимость за один млн возьмем из тарифов на GigaChat 3.5 Ultra от Cloud.ru. Входные — 96 ₽, генерируемые — 289 ₽.
Модель построена на архитектуре MoE (Mixture-of-Experts): из 432 млрд параметров на каждый запрос активируется только ~28 млрд, что позволяет оптимизировать затраты.
Расчет:
3 × 96 + 2 × 289 = 866 ₽ в месяц
За один год при неизменных тарифах и постоянном объеме получается 10 392 ₽, за три года — приблизительно 31 176 ₽.
Сумма будет зависеть не только от количества и соотношения токенов, но и от выбранной модели, дополнительных сервисов.
При сравнении с локальной инфраструктурой нужно взять полный TCO GPU-сервера за аналогичный срок, например, три года. Учитывайте утилизацию GPU и определите точку окупаемости. При небольшой нагрузке скорее всего экономически выиграет облачный вариант.
Гибридная архитектура: как совместить оба подхода
Это концепция, когда чувствительные данные и критичные операции остаются внутри корпоративного контура, а для остальных задач используются облачные ресурсы. Рассмотрим, как ее реализовать.
Маршрутизация по чувствительности данных
Схематично концепция выглядит так:
Пользователь → маршрутизатор → классификация данныхМаршрутизатор определяет тип информации и направляет запрос к нужной модели. К локальной, если используются чувствительные данные (персональные, коммерческие, технические). В остальных случаях — к облачной.
Здесь нужны четкие политики классификации данных и разграничения доступа. Также желательно внедрить журналирование всех операций.
Облачная модель для генерации + локальный RAG
В этом сценарии векторная база данных и документы остаются внутри компании, а генеративная модель используется в облаке, куда направляется только необходимый контекст конкретного запроса. При этом действуют правила, определяющие, какую информацию можно передавать.
От перехвата информации при отправке внешней модели может защитить механизм Guardrails в Evolution Foundation Models. Он проверяет запросы и ответы, обнаруживает чувствительные данные и маскирует их плейсхолдерами вроде <EMAIL_1>. Языковая модель без проблем расшифрует текст и выдаст пользователю понятный результат.
Сравнение вариантов по семи критериям
Чем отличаются ИИ-агенты:
Критерий | Локальный | Облачный | Гибридный |
Контроль данных | Максимальный | Зависит от условий провайдера и настроек сервиса | Чувствительные данные остаются внутри компании, поэтому хорошо контролируются |
Стартовые затраты | Высокие — нужно разворачивать инфраструктуру и выделять вычислительные ресурсы | Низкие — ничего не придется покупать | Средние — будут расходы на часть ресурсов |
Стоимость на 1 млн токенов | Зависит от загрузки GPU и TCO | Тариф за использование модели | Зависит от маршрутизации |
Срок запуска | От недель до месяцев в зависимости от готовности инфраструктуры | Быстро, поскольку ресурсы предоставляет провайдер | Зависит от сложности интеграции и распределения компонентов |
Доступ к новым моделям | Нужно самостоятельно внедрять и тестировать модели | Обычно быстрее | Новые модели можно подключать в облаке, а часть сценариев сохранять на локальных |
Масштабирование на подразделения | Требует дополнительных мощностей | Ресурсы можно масштабировать по мере роста нагрузки | Нагрузка распределяется между локальной и облачной инфраструктурой |
Ответственность за эксплуатацию | На компании | Значительная часть — на провайдере | На компании и провайдере |
Как Cloud.ru закрывает оба сценария
Есть инструменты для обоих вариантов архитектуры — облачного запуска и развертывания локальных LLM.
В облаке: Evolution AI Agents и Evolution Foundation Models
Evolution AI Agents — сервис для разработки, развертывания и эксплуатации автономных ИИ-агентов и мультиагентных систем. Доступны интеграция с MCP-серверами для подключения к разным источникам данных, мониторинг и трейсинг моделей, инструменты для управления и масштабирования.
Evolution Foundation Models через API предоставляет доступ к готовым ИИ-моделям. В каталоге более 20 решений, среди которых GigaChat, Qwen, GLM и DeepSeek.
Можно тестировать выбранные модели в рамках пилотного проекта, чтобы до полноценного внедрения оценить качество, производительность и соответствие задачам бизнеса.
В контуре компании: Cloud.ru Evolution Stack
Платформа Cloud.ru Evolution Stack предназначена для создания приватного и гибридного облака на стороне заказчика. Она помогает объединять on-premise-инфраструктуру с публичным облаком Cloud.ru Evolution. В составе: инструменты управления, Kubernetes, системы хранения, реестры артефактов.
Платформа имеет сертификат ФСТЭК России (4 уровень доверия), что подтверждает соответствие требованиям регулятора к защите информации и позволяет использовать решение в проектах с самыми строгими требованиями — в том числе для объектов КИИ, ГИС, ИСПДн и АСУ ТП.
Для развертывания и запуска ML-моделей можно использовать сервис Evolution ML Inference. Он позволяет собрать свою конфигурацию для запуска инференса, обеспечивает динамическое автомасштабирование мощностей.
Кейс Cloud.ru: ИИ-ассистент инженера поддержки сократил время решения сложных обращений в два раза в AI Factory
ИИ-ассистента внедрили, чтобы забрать рутину и усилить работу специалистов. Он помогает обрабатывать обращения, искать информацию, готовить ответы, автоматически закрывать типовые задачи. Чтобы помощник справлялся эффективнее, под RAG адаптировали более 25 000 статей внутренней документации.
Результаты:
среднее время обработки сложных запросов сократилось в 2 раза;
NPS вырос на 12 пунктов;
индекс удовлетворенности клиентов после масштабирования держится на уровне 92–93%;
через ИИ проходит 75–80% ответов инженеров.
К концу 2025 года ассистент самостоятельно закрывал 55% задач первой линии, связанных с ответами пользователям и маршрутизацией обращений.
Чек-лист: 8 вопросов перед выбором архитектуры
Ответы помогут определить, какой ИИ-агент лучше для ваших задач и где его развернуть:
Какие данные получает агент? Выясните, есть ли среди них чувствительные.
Какие действия выполняет агент? Определите необходимые полномочия и права доступа.
Какая ожидается нагрузка? Рассчитайте количество запросов и токенов за час, сутки и месяц.
Как меняется нагрузка? Оцените, насколько стабилен объем запросов.
Какое качество модели требуется? Подумайте, справится ли локальная модель с поставленными задачами или потребуется более мощная.
Какие требования к ИБ? Уточните, можно ли передавать данные во внешнюю инфраструктуру.
Кто будет сопровождать решение? Оцените наличие специалистов по инфраструктуре, GPU, MLOps и ИБ.
Какой TCO выйдет за три года? Рассчитайте расходы на инфраструктуру, ресурсы, эксплуатацию, поддержку и обновления.
Cloud.ru Agents Space: готовое пространство для персональных ИИ-агентов
В августе 2026 года Cloud.ru представил Cloud.ru Agents Space — пространство для использования и создания персональных ИИ-агентов, которое работает на технологическом стеке AI Factory. Это решение скрывает техническую сложность: пользователю не нужно самостоятельно выбирать инфраструктуру, настраивать модели и управлять средой запуска .
Что доступно в пространстве:
Готовые агенты. На старте доступен ГигаАгент — автономный универсальный агент для работы с документами, календарем, перепиской, а также для создания отчетов и презентаций. В основе ГигаАгента — open-source проект Ouroboros.
Создание собственных агентов. Можно выбрать подходящего агента под конкретную задачу или создать собственного.
Кроссплатформенность. Работа доступна как на компьютере, так и на телефоне.
Стартовый грант. Новым пользователям доступно 4 000 ₽ для бесплатного тестирования возможностей.
Agents Space подходит тем, кто хочет быстро попробовать ИИ-агентов в деле, не разбираясь в настройке инфраструктуры. Для корпоративных сценариев предусмотрена enterprise-версия с возможностью подключения собственных агентов и локального развертывания.
Заключение
При выборе отбросьте критерии вроде «безопаснее», «дешевле» или «быстрее» и опирайтесь на специфику задач, данных и процессов. Локальный контур оправдан там, где есть постоянная нагрузка и чувствительная информация. В других случаях ИИ-агентов дешевле и быстрее запускать в облаке. Если хочется большей гибкости, стоит посмотреть в сторону гибрида с маршрутизацией по типу данных.
Перед развертыванием можно протестировать агентов в Evolution AI Agents или обсудить архитектуру с командой Cloud.ru.
FAQ
Что такое ИИ-агент простыми словами?
Это автономная интеллектуальная система, которая воспринимает среду через MCP-серверы и API, анализирует информацию и принимает решения, планирует последовательность шагов для достижения цели, выполняет действия через инструменты и адаптируется к изменяющимся условиям . В отличие от ассистента, который только отвечает на запросы, агент сам инициирует действия и не требует постоянных инструкций от человека.
Чем локальный ИИ-агент отличается от облачного?
Локальный работает в выделенном частном контуре или внутри инфраструктуры. Облачный — на стороне провайдера, который обеспечивает вычислительные ресурсы.
Сколько стоит локальное развертывание LLM для компании?
Фиксированной суммы нет, поскольку в расходы нужно закладывать стоимость «железа» и инфраструктуры вокруг него, работ по настройке и сопровождению.
Можно ли использовать облачный ИИ-агент с персональными данными по 152-ФЗ?
Выбор в пользу облачной концепции не означает, что компания нарушает закон. Учитываются конкретные требования к обработке данных, аттестации платформы и фактические меры защиты информации.
Что такое гибридный ИИ и когда он нужен?
Это подход, позволяющий одновременно использовать как локальных, так и облачных агентов. Чувствительную информацию можно обрабатывать в контуре компании, остальные запросы — через ресурсы провайдера.
Какой ИИ-агент выбрать для 1С и внутренних систем?
Выбор зависит от конкретной задачи и набора интеграций. Для внутренних систем стоит проверить поддержку API и MCP, возможность подключить корпоративную базу знаний, настроить права доступа и журналирование. Перед масштабированием лучше провести пилот на реальных бизнес-процессах.
Как проверить безопасность ИИ-агента перед внедрением?
Сначала можно запустить ИИ-помощника в изолированной среде и понаблюдать за его поведением, предоставив минимальные полномочия. Полезно провести и комплексное тестирование на наличие уязвимостей.
