Сравнение нейросетей: GPT, Claude, Gemini, DeepSeek и другие
Подробно рассказываем, что такое CDN и как она используется. Разбираемся, нужна ли она вашему бизнесу и как правильно выбрать партнера, чтобы получить удовольствие и повышение прибыли в процессе работы.

- Как мы сравниваем нейросети: методология
- GPT-5.5 (OpenAI) — универсал с крупнейшей экосистемой
- Claude (Anthropic) — лидер для кода и сложных задач
- Gemini 3.1 Pro (Google DeepMind) — лидер бенчмарков и исследований
- DeepSeek V4 (DeepSeek) — лучшая цена и открытые веса
- Другие модели, о которых стоит знать
- Итоговое сравнение: какую нейросеть выбрать под задачу
- Где запустить эти модели в России: Evolution Foundation Models
- Когда нужен не API, а агент: Evolution AI Agents
За первые две недели июня 2026 рынок больших языковых моделей (Large Language Model, LLM) получил сразу несколько заметных обновлений. 9 июня Anthropic представила Claude Fable 5, которая показала результат 95% в бенчмарке SWE-bench Verified. В это же время лаборатория MiniMax из Шанхая выпустила открытую модель M3, а Microsoft представила MAI-Code-1-Flash — модель, ориентированную на задачи программирования.
Рынок LLM меняется буквально каждую неделю, поэтому выбрать подходящую нейросеть становится все сложнее. Универсального решения нет: одна модель лучше пишет код, другая быстрее анализирует данные. Выбор всегда зависит от конкретной задачи, требований к скорости, стоимости и качеству ответа.
В этой статье разберем, чем отличаются ключевые модели, на каких задачах каждая из них работает лучше всего, и как выбрать нужный инструмент под задачи бизнеса.
Как мы сравниваем нейросети: методология
Бенчмарки помогают сравнить модели, но не дают полной картины. На практике результат зависит не только от самой нейросети, но и от того, как она используется: какие инструменты подключены, как настроен процесс работы и какая задача решается.
Поэтому мы сравниваем модели по четырем критериям: качеству ответов, скорости работы, стоимости использования и тому, насколько хорошо они подходят для конкретных задач — программирования, аналитики, научных исследований и работы с текстом.
Что показывают бенчмарки
У разных бенчмарков разные задачи, поэтому сравнивать модели только по одному показателю некорректно.
SWE-bench оценивает способность нейросети решать задачи из GitHub-репозиториев и показывает, насколько хорошо модель справляется с программированием.
GPQA Diamond проверяет сложные знания в области естественных наук — физики, биологии и химии.
ARC-AGI-2 оценивает способность модели находить решения для новых абстрактных задач.
MMLU показывает общий уровень знаний в 57 предметных областях.
При этом результаты бенчмарков зависят не только от самой модели. Например, одна и та же версия Claude Opus может показывать разные результаты в SWE-bench в зависимости от используемого скаффолдинга — набора инструментов, агентов и настроек, которые помогают модели решать задачу.
При выборе LLM важно оценивать не только рейтинг модели, но и всю систему, в которой она работает: модель, инструменты, настройки и конкретный сценарий применения.
Почему «искусственный интеллект» в 2026 году — понятие узкозадачное
У современных нейросетей нет единого показателя «ума» — каждая модель сильнее в определенных сценариях.
Бенчмарк GPQA DiamondНапример, Gemini 3.1 Pro показывает высокие результаты в научных задачах по GPQA Diamond — 94,3%.
Бенчмарк Humanity’s Last ExamGrok 4 демонстрирует результат 54% на Public Score бенчмарка Humanity's Last Exam.
Бенчмарк SWE-bench Pro и другиеClaude Opus 4.8 показывает один из лучших результатов в задачах по программированию — 88,6% на бенчмарке SWE-bench Verified. Поэтому при выборе нейросети важно смотреть не на общий рейтинг, а на то, насколько хорошо модель справляется именно с теми задачами, которые нужно решать.

GPT-5.5 (OpenAI) — универсал с крупнейшей экосистемой
GPT-5.5 — один из самых универсальных вариантов для бизнеса, которому нужна одна модель для разных задач: работы с текстами, анализа данных, программирования и автоматизации процессов.
Окно ChatGPTGPT-5.5 Instant стала моделью по умолчанию в ChatGPT (GPT-5.3 Instant остается доступна как опция в течение трех месяцев). При этом, по данным OpenAI, по сравнению с GPT-5.3 Instant количество галлюцинаций снизилось на 52,5%, а число неточных утверждений в размеченных диалогах — на 37,3%.
Через программный интерфейс приложения (API) стоимость модели составляет $5 за млн входных токенов и $30 за млн выходных токенов. В ChatGPT она доступна в бесплатной версии с ограничениями, а также в тарифах Plus ($20 в месяц) и Pro ($100–200 в месяц).
Главное преимущество GPT-5.5 — развитая экосистема инструментов. Сильные стороны GPT-5.5 — работа с инструментами (tool use), вызов функций (function calling), мультимодальность, развитая экосистема OpenAI и создание многошаговых ИИ-агентов.
При этом GPT-5.5 не всегда оптимальна для узких задач. Например, при работе с большими объемами данных важным фактором становится размер контекстного окна: у GPT-5.5 оно составляет 256 000 токенов, тогда как некоторые конкурирующие модели предлагают до 1 миллиона токенов.

Claude (Anthropic) — лидер для кода и сложных задач
Claude нередко выбирают разработчики, которым нужно не просто написать часть кода, а разобраться в большой задаче: понять существующий проект, найти ошибки или аккуратно изменить уже работающую систему.
Окно Claude CodeМодель Claude Fable 5 вышла в начале лета 2026 года и показала 95% на SWE-bench Verified — одном из тестов для оценки качества программирования. Стоимость модели через API составляет $10 за млн входных токенов и $50 за млн выходных, а контекстное окно достигает 1 млн токенов.
Opus 4.8 набрала в тесте SWE-bench Verified 88,6%, а ее использование стоит $5 за млн входных токенов и $25 за млн выходных.
Для ежедневной работы с кодом подойдет Claude Sonnet 4.6. Модель стоит дешевле — $3 за млн входных токенов и $15 за млн выходных, при этом сохраняет хорошее качество для большинства задач разработки.
Gemini 3.1 Pro (Google DeepMind) — лидер бенчмарков и исследований
Gemini 3.1 Pro показывает высокие результаты в ряде бенчмарков, включая 77,1% в ARC-AGI-2. Модель набирает 94,3% в GPQA Diamond для научных задач, 80,6% в SWE-bench Verified для программирования и 77,1% в ARC-AGI-2 для проверки абстрактного рассуждения.
Окно GeminiОдно из преимуществ Gemini 3.1 Pro — контекстное окно объемом 1 млн токенов, которое удобно для работы с большими документами, кодовыми базами и массивами данных. При этом стоимость остается относительно низкой: $2 за млн входных токенов и $12 за млн выходных.
Модель подходит компаниям, которым нужна универсальная система для анализа информации, работы с исследованиями, программирования и задач, где важно сочетание качества, скорости и стоимости.
DeepSeek V4 (DeepSeek) — лучшая цена и открытые веса
DeepSeek V4 подойдет тем, кому нужна недорогая модель с возможностью развернуть ее вручную. Модель показывает качество, которое сопоставимо с топовыми решениями, но будет дешевле в использовании.
Окно DeepSeekDeepSeek V4 Flash — один из самых доступных вариантов для работы с ИИ: стоимость составляет около $0,14 за миллион входных токенов и $0,28 за миллион выходных. Если важнее качество в сложных задачах, включая программирование, подойдет версия V4-Pro — она дает более высокий результат при умеренной стоимости.
Еще плюс DeepSeek — открытые веса. Компании могут запускать модель на своей инфраструктуре, контролировать критическую или корпоративную информацию, а также не зависеть от внешних API.
Другие модели, о которых стоит знать
Кроме флагманов, на рынке есть модели, которые подходят для других задач. Эти LLM могут выигрывать за счет цены, работы с русским языком, открытого кода или возможности развертывания внутри компании.
MiniMax M3 — открытый код frontier-уровня
Окно MiniMax M3MiniMax M3 — открытая модель от MiniMax, в которой можно программировать и создавать ИИ-агентов. Она построена на архитектуре Mixture of Experts, поддерживает контекст до 1 млн токенов и умеет работать не только с текстом, но и с изображениями и видео. Стоимость входных токенов — около $0,30 за млн.
MiniMax M3 на бенчмарке SWE-bench ProСогласно данным производителя модель набирает 80,5% на SWE-bench Verified, превосходя GPT-5.5 и Gemini 3.1 Pro на этом бенчмарке. Для команд, которым нужна мультимодальность и возможность самостоятельного хостинга при бюджете значительно ниже западных проприетарных моделей, M3 — реальная альтернатива.
Qwen 3.7 Max — сильный кандидат
Окно Qwen 3.7 MaxQwen 3.7 Max от Alibaba входит в число сильных моделей среднего сегмента. Модель доступна через Model Studio Alibaba Cloud. Вместе с DeepSeek V4 она конкурирует с MiniMax M3 в задачах разработки и создания ИИ-агентов. DeepSeek V4 и MiniMax M3 распространяются с открытыми весами, что позволяет использовать их в собственных решениях и при необходимости разворачивать в своей инфраструктуре.
GLM-5.1 — открытая модель, обошедшая закрытые
GLM-5.1 на бенчмарке SWE-bench ProGLM-5.1 от Z.ai доступна через высокоскоростное API со скоростью 400 токенов в секунду, что делает ее привлекательной для задач, требующих быстрой обработки запросов. Модель распространяется под открытой лицензией MIT, поэтому подойдет бизнесу для коммерческого использования.
GigaChat 2 MAX (Сбер) — российская специфика
Окно GigaChat
GigaChat на бенчмарке MERAGigaChat 2 MAX от Сбера поддерживает контекст до 131 000 токенов и подходит для работы с документами, в которых важны локальная терминология и особенности российского законодательства. По данным Сбера, модель занимает первое место в открытом бенчмарке MERA.
Итоговое сравнение: какую нейросеть выбрать под задачу
В таблице сравнения нейросетей можно выбрать ИИ по конкретному сценарию использования.
Задача | Подходящие модели | Цена API (за 1 млн токенов, вход/выход) | Почему |
Сложный код и рефакторинг | Claude Opus 4.8, Claude Fable 5 | $5/$25 — $10/$50 | Сильные результаты в задачах программной инженерии и работе с большими кодовыми базами |
Повседневная разработка | Claude Sonnet 4.6 | $3/$15 | Хороший баланс между качеством, скоростью и стоимостью |
Научные задачи и анализ исследований | Gemini 3.1 Pro | Около $2–3/$10–12 | Высокие результаты в научных бенчмарках, включая GPQA Diamond |
Универсальный ИИ-ассистент | GPT-5.5 | $5/$30 | Широкий набор инструментов: function calling, мультимодальность, агенты и большая экосистема |
Массовые задачи с ограниченным бюджетом | DeepSeek V4 Flash | $0,14/$0,28 | Низкая стоимость при большом объеме запросов |
Русскоязычные сценарии | GigaChat 2 MAX | Зависит от тарифа | Адаптация под русский язык и локальные бизнес-задачи |
Развертывание внутри своей инфраструктуры | MiniMax M3, Qwen 3.7 | от $0,30 | Открытые веса позволяют запускать модели на собственных серверах |
Где запустить эти модели в России: Evolution Foundation Models
GPT-5.5, Claude и Gemini недоступны напрямую из России, а отдельные прокси для каждой модели усложняют интеграцию и работу с данными. Evolution Foundation Models позволяет подключаться к разным моделям через единый API.
Что такое Evolution Foundation Models
Возможности сервиса Evolution Foundation ModelsEvolution Foundation Models — сервис с доступом к популярным генеративным моделям через единый API. Платформа предоставляет более 20 моделей с открытыми весами, включая gpt-oss, DeepSeek и Qwen. Подключение происходит через OpenAI-совместимый API — не нужно развертывать собственный инференс или писать дополнительный адаптерный код.
Какие из рассмотренных моделей доступны
В каталоге Evolution Foundation Models представлены модели из семейств GLM, Qwen, DeepSeek, MiniMax, GigaChat и других.
Модель | Доступна в Evolution Foundation Models | Контекст | Цена (вход/выход, 1М токенов) |
Qwen3-Coder-Next | Да | 262K | 122 / 244 ₽ |
GigaChat 2 MAX | Да | 131K | 569 / 569 ₽ |
MiniMax-M2.5 | Да | 196K | 354 / 476 ₽ |
GLM-4.7 | Да | 202K | 549 / 793 ₽ |
DeepSeek | Да | Зависит от модели | По тарифу |
gpt-oss | Да | Зависит от модели | По тарифу |
Все модели развернуты на российских серверах, что соответствует требованиям к хранению и обработке данных.
Возможности для бизнеса
Модели поддерживают рассуждение (Reasoning), вызов функций (Function Calling) и структурированный вывод (Structured Output). Безопасность реализована на двух уровнях: инструмент Guardrails Filter маскирует чувствительные данные до отправки в модель, а Guardrails LLM анализирует запросы на скрытые инструкции, которые пытаются переопределить системный промпт.
Как это может работать на практике? Команда финтех-стартапа хочет подключить ИИ-ассистента для обработки обращений клиентов. Данные — персональные: имена, суммы, реквизиты. Передавать их напрямую в зарубежную модель юридически рискованно. Через Evolution Foundation Models команда подключается к DeepSeek или Qwen по OpenAI-совместимому API, при этом фильтр Guardrails автоматически маскирует чувствительные поля до отправки запроса. Ответы хранятся на российских серверах Cloud.ru. В результате стартап получает нужную функциональность без компромисса по комплаенсу.
Как начать за четыре шага
Нужно войти в личный кабинет → перейти в раздел Foundation Models → выбрать нужную модель и нажать «Использовать» → создать API-ключ и подключиться по OpenAI-совместимому API согласно документации. Стандартный лимит — 20 запросов в секунду на ключ. Если нагрузка выше, Cloud.ru разворачивает частный экземпляр в сервисе Evolution ML Inference.
Когда нужен не API, а агент: Evolution AI Agents
Есть важное разграничение, которое часто упускают: модель отвечает на один запрос. Агент — это другое. Он планирует цепочку действий, вызывает инструменты, обращается к внешним данным, а потом корректирует план на основе промежуточных результатов. Для большинства бизнес-задач это принципиальная разница.
Что такое Evolution AI Agents

Возможности сервиса Evolution AI AgentsEvolution AI Agents — облачный сервис Cloud.ru для создания автономных ИИ-агентов и мультиагентных систем. Ключевые возможности: объединение до пяти агентов в единую систему с координацией по протоколу Agent-to-Agent, интеграция с источниками данных через протокол MCP (Model Context Protocol), подключение корпоративной базы знаний через Evolution Managed RAG.
Выбор модели для агента
В Evolution AI Agents можно развернуть агента, подключить MCP-сервер для Evolution Managed RAG и выстроить сложный сценарий, в котором запрос решается через несколько последовательных шагов с обращением к базе знаний. Для агента-кодера логичен выбор Qwen3-Coder или DeepSeek; для русскоязычного ассистента — GigaChat. Для высоконагруженных сценариев с упором на экономию — DeepSeek V4 Flash.
Представьте компанию с большим объемом внутренних документов: договоры, регламенты, технические спецификации. Вместо того чтобы вручную искать нужный пункт, менеджер задает вопрос агенту в Evolution AI Agents. Агент обращается к корпоративной базе знаний через Evolution Managed RAG, находит подходящие фрагменты, формулирует ответ и при необходимости задает вопросы менеджеру.
Мониторинг и no-code
AI Factory включает инструменты не только для создания, но и для сопровождения ИИ-агентов. Например, Arize Phoenix помогает отслеживать, как агент принимает решения и на каком этапе возникают ошибки. А Agent Space предоставляет готовый интерфейс для работы с ними через веб, настольное или мобильное приложение.
API или агент — что выбрать
Сценарий | Evolution Foundation Models | Evolution AI Agents |
Разовый запрос к модели | Достаточно | Избыточно |
Цепочка из 3 и более шагов | Нужно самостоятельно реализовать логику | Поддерживается A2A-координация |
Работа с корпоративными данными | Интеграцию нужно реализовать самостоятельно | Поддерживаются MCP и Evolution Managed RAG |
Мониторинг качества | Не предусмотрен | Доступен Arize Phoenix |
Автоматизация без программирования | Нет | Доступны AI Workflows |
Часто задаваемые вопросы
Собрали ответы на самые частые вопросы о нейросетях, моделях и их использовании.
Какая нейросеть лучшая в 2026 году?
Единого ответа нет. Согласно бенчмаркам, Claude Fable 5 лидирует в сложном коде, Gemini 3.1 Pro — в научных задачах, GPT-5.5 — универсальный выбор, DeepSeek V4 Flash — оптимален по цене при масштабировании.
Какая нейросеть самая дешевая?
По входным токенам — DeepSeek V4 Flash: $0,14 за млн токенов. Это примерно в 35 раз дешевле Claude Opus 4.8 и в 36 раз дешевле GPT-5.5.
Как использовать GPT и Claude из России?
Через открытые аналоги в Evolution Foundation Models: DeepSeek, Qwen, GLM и другие подключаются по тому же OpenAI-совместимому API без необходимости настраивать доступ через зарубежные сервисы.
Чем агент отличается от обычной нейросети?
Модель отвечает на один запрос. Агент выполняет цепочку действий: планирует, вызывает инструменты, обращается к внешним данным и корректирует ответ по ходу выполнения задачи.
Безопасно ли передавать корпоративные данные в нейросеть?
Через Evolution Foundation Models Cloud.ru — данные обрабатываются на российских серверах, а двухуровневая система Guardrails маскирует чувствительную информацию до отправки в модель и защищает от скрытых инструкций в запросах.
Какую модель выбрать для русского языка?
GigaChat 2 MAX занимает первое место в открытом бенчмарке MERA для русского языка и ориентирована на работу с русскоязычными текстами, документами и деловой перепиской.

