Большие данные представляют как захватывающие возможности, так и огромный вызов. По мере того как объём и типы данных быстро растут, традиционные технологии обработки данных, такие как автономные системы хранения и реляционные базы данных, не успевают за ними. Чтобы решить эту задачу, Apache Software Foundation (ASF) запустила открытый проект под названием Hadoop. Hadoop — это открытая распределённая вычислительная платформа, которая может полностью использовать вычислительные и хранилищные возможности крупных вычислительных кластеров для обработки огромных объёмов данных. Hadoop — мощный фреймворк, но его развертывание и эксплуатация не являются простыми — если предприятия пытаются развернуть системы Hadoop самостоятельно, они могут столкнуться с проблемами, такими как высокие затраты, длительный ввод в эксплуатацию, сложное обслуживание и негибкое использование.
MapReduce Service (MRS) предлагает комплексный сервис, который помогает быстро развернуть и управлять системами Hadoop в облаке с лёгкостью. С помощью MRS вы можете создать кластер Hadoop корпоративного класса всего в несколько щелчков мыши. Тенанты имеют полный контроль над своими кластерами Hadoop и могут без усилий запускать компоненты больших данных, такие как Storm, Hadoop, Spark, HBase и Kafka. MRS поддерживает полный набор открытых API и, используя глубокую экспертизу облачной платформы в области вычислений, хранения и больших данных, предлагает клиентам полнофункциональную платформу больших данных с высокой производительностью, высокой экономичностью, гибкостью и простотой использования. Кроме того, платформу можно легко адаптировать под новые требования и помочь предприятиям быстро построить масштабную систему обработки данных и открыть новую ценность и бизнес‑возможности, анализируя и добывая огромные объёмы данных в реальном времени или в нережим реального времени.
Figure 1 показывает логическую архитектуру MRS.
Рисунок 1 MRS архитектура

MRS включает инфраструктуру и сквозной конвейер обработки больших данных.
Кластеры больших данных MRS полностью используют высокую масштабируемость, надёжность и функции безопасности уровня виртуализации, предоставляемого облачной платформой.
Слой сбора данных обеспечивает возможность эффективного ввода данных из различных источников данных. Он состоит из Flume (ввод данных), Loader (загрузка реляционных данных) и Kafka (высоконадежная очередь сообщений). В качестве альтернативы вы можете использовать сервис Cloud Data Migration (CDM) для ввода внешних данных в кластеры MRS.
Кластеры MRS могут хранить как структурированные, так и неструктурированные данные. Они поддерживают несколько эффективных форматов данных, чтобы удовлетворять требования различных вычислительных движков, включая:
Результаты анализа данных отображаются интуитивно. MRS также интегрируется с DataArts Studio, предоставляя универсальную совместную платформу разработки больших данных, помогая легко выполнять широкий спектр задач, таких как моделирование данных, интеграция данных, разработка скриптов, планирование задач и мониторинг O&M, делая большие данные более доступными, чем когда‑либо.
Все компоненты экосистемы больших данных на основе Hadoop развернуты в распределённом режиме, и их развертывание, управление и O&M являются сложными.
MRS предоставляет единый O&M и управленческий платформу для управления кластером, поддерживая развертывание кластера в один клик, выбор нескольких версий, а также ручное масштабирование и автоматическое масштабирование кластеров без прерывания обслуживания. Кроме того, MRS обеспечивает управление задачами, управление тегами ресурсов и O&M всех компонентов Hadoop. Универсальные возможности O&M включают мониторинг, отчётность о тревогах, настройку параметров и обновление патчей.
MRS имеет сильную команду ядра Hadoop и построен на базе корпоративной платформы больших данных FusionInsight. MRS может гарантировать многоуровневые соглашения об уровне обслуживания (SLA).
MRS имеет следующие преимущества:
MRS поддерживает решение хранения CarbonData. CarbonData позволяет использовать одну копию данных для выполнения нескольких задач. Он поддерживает такие функции, как многоуровневое индексирование, словарное кодирование, предагрегация, динамическое разбиение и квазиреальное время запросов данных. Эти функции улучшают сканирование I/O и вычислительную производительность, позволяя анализировать десятки миллиардов записей данных за секунды. Кроме того, MRS поддерживает Superior Scheduler, который превосходит open-source планировщики во всех отношениях и обеспечивает эффективное планирование в очень больших кластерах (до 10 000 узлов).
MRS поддерживает гетерогенную инфраструктуру вычислений и хранения с разъединёнными хранилищем и вычислениями, предлагая экономичное решение массового хранения. MRS поддерживает быстрое автоматическое масштабирование для удовлетворения изменяющегося спроса, максимизируя использование ресурсов для клиентов. Кластеры MRS могут быть быстро созданы и масштабированы по мере необходимости, а также могут быть удалены или масштабированы, когда они больше не нужны.
MRS предоставляет корпоративного уровня управление разрешениями в многотенантной среде и управление безопасностью, поддерживая контроль доступа на уровне таблиц и столбцов, а также шифрование данных.
MRS предоставляет эффективную платформу управления кластерами больших данных, поддерживающую однощёлчковые скользящие обновления патчей, обеспечивая непрерывность ваших сервисов.
Проверенная и доказанная в многочисленных проектах, долгосрочная надёжность и стабильность MRS в масштабных развертываниях может соответствовать корпоративным стандартам для производственных систем. Кроме того, MRS поддерживает автоматическое резервное копирование данных между AZ и регионами, а также автоматическую антиаффинность, позволяя критически важным ВМ распределять на разных физических машинах.