Облачная платформаAdvanced

Что такое MRS?

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

Большие данные представляют как захватывающие возможности, так и огромный вызов. По мере того как объём и типы данных быстро растут, традиционные технологии обработки данных, такие как автономные системы хранения и реляционные базы данных, не успевают за ними. Чтобы решить эту задачу, Apache Software Foundation (ASF) запустила открытый проект под названием Hadoop. Hadoop — это открытая распределённая вычислительная платформа, которая может полностью использовать вычислительные и хранилищные возможности крупных вычислительных кластеров для обработки огромных объёмов данных. Hadoop — мощный фреймворк, но его развертывание и эксплуатация не являются простыми — если предприятия пытаются развернуть системы Hadoop самостоятельно, они могут столкнуться с проблемами, такими как высокие затраты, длительный ввод в эксплуатацию, сложное обслуживание и негибкое использование.

MapReduce Service (MRS) предлагает комплексный сервис, который помогает быстро развернуть и управлять системами Hadoop в облаке с лёгкостью. С помощью MRS вы можете создать кластер Hadoop корпоративного класса всего в несколько щелчков мыши. Тенанты имеют полный контроль над своими кластерами Hadoop и могут без усилий запускать компоненты больших данных, такие как Storm, Hadoop, Spark, HBase и Kafka. MRS поддерживает полный набор открытых API и, используя глубокую экспертизу облачной платформы в области вычислений, хранения и больших данных, предлагает клиентам полнофункциональную платформу больших данных с высокой производительностью, высокой экономичностью, гибкостью и простотой использования. Кроме того, платформу можно легко адаптировать под новые требования и помочь предприятиям быстро построить масштабную систему обработки данных и открыть новую ценность и бизнес‑возможности, анализируя и добывая огромные объёмы данных в реальном времени или в нережим реального времени.

Архитектура продукта

Figure 1 показывает логическую архитектуру MRS.

Рисунок 1 MRS архитектура


MRS включает инфраструктуру и сквозной конвейер обработки больших данных.

  • Инфраструктура

    Кластеры больших данных MRS полностью используют высокую масштабируемость, надёжность и функции безопасности уровня виртуализации, предоставляемого облачной платформой.

    • Virtual Private Cloud (VPC) предоставляет виртуальные частные сети для каждого тенанта в облаке.
    • Elastic Volume Service (EVS) предоставляет надёжное и высокопроизводительное хранилище.
    • Elastic Cloud Server (ECS) предоставляет виртуальные машины, которые легко масштабируются. Он работает с VPC, группами безопасности и механизмом многократной репликации EVS, чтобы построить эффективную, надёжную и безопасную вычислительную среду.

  • Сбор данных

    Слой сбора данных обеспечивает возможность эффективного ввода данных из различных источников данных. Он состоит из Flume (ввод данных), Loader (загрузка реляционных данных) и Kafka (высоконадежная очередь сообщений). В качестве альтернативы вы можете использовать сервис Cloud Data Migration (CDM) для ввода внешних данных в кластеры MRS.

  • Хранилище данных

    Кластеры MRS могут хранить как структурированные, так и неструктурированные данные. Они поддерживают несколько эффективных форматов данных, чтобы удовлетворять требования различных вычислительных движков, включая:

    • HDFS, который является универсальной распределённой файловой системой для платформ больших данных.
    • OBS — это сервис объектного хранилища, обладающий высокой доступностью и низкой стоимостью.
    • HBase, который поддерживает хранение данных с индексами, ускоряя запросы, основанные на индексах.
  • Конвергентная обработка данных
    • MRS поддерживает несколько основных вычислительных движков, включая MapReduce (пакетная обработка), Tez (модель DAG), Spark (вычисления в памяти), Spark Streaming (микропакетная потоковая обработка), Storm (потоковая обработка) и Flink (потоковая обработка). Они преобразуют структуры данных и логику в модели данных, соответствующие потребностям различных приложений больших данных.
    • На основе предустановленных моделей данных и удобного SQL‑анализа пользователи могут выбирать Hive (хранилище данных), SparkSQL и Presto (интерактивный движок запросов) для выполнения различных аналитических задач.
  • Отображение данных и планирование

    Результаты анализа данных отображаются интуитивно. MRS также интегрируется с DataArts Studio, предоставляя универсальную совместную платформу разработки больших данных, помогая легко выполнять широкий спектр задач, таких как моделирование данных, интеграция данных, разработка скриптов, планирование задач и мониторинг O&M, делая большие данные более доступными, чем когда‑либо.

  • Управление кластером

    Все компоненты экосистемы больших данных на основе Hadoop развернуты в распределённом режиме, и их развертывание, управление и O&M являются сложными.

    MRS предоставляет единый O&M и управленческий платформу для управления кластером, поддерживая развертывание кластера в один клик, выбор нескольких версий, а также ручное масштабирование и автоматическое масштабирование кластеров без прерывания обслуживания. Кроме того, MRS обеспечивает управление задачами, управление тегами ресурсов и O&M всех компонентов Hadoop. Универсальные возможности O&M включают мониторинг, отчётность о тревогах, настройку параметров и обновление патчей.

Преимущества продукта

MRS имеет сильную команду ядра Hadoop и построен на базе корпоративной платформы больших данных FusionInsight. MRS может гарантировать многоуровневые соглашения об уровне обслуживания (SLA).

MRS имеет следующие преимущества:

  • Высокая производительность

    MRS поддерживает решение хранения CarbonData. CarbonData позволяет использовать одну копию данных для выполнения нескольких задач. Он поддерживает такие функции, как многоуровневое индексирование, словарное кодирование, предагрегация, динамическое разбиение и квазиреальное время запросов данных. Эти функции улучшают сканирование I/O и вычислительную производительность, позволяя анализировать десятки миллиардов записей данных за секунды. Кроме того, MRS поддерживает Superior Scheduler, который превосходит open-source планировщики во всех отношениях и обеспечивает эффективное планирование в очень больших кластерах (до 10 000 узлов).

  • Экономичность

    MRS поддерживает гетерогенную инфраструктуру вычислений и хранения с разъединёнными хранилищем и вычислениями, предлагая экономичное решение массового хранения. MRS поддерживает быстрое автоматическое масштабирование для удовлетворения изменяющегося спроса, максимизируя использование ресурсов для клиентов. Кластеры MRS могут быть быстро созданы и масштабированы по мере необходимости, а также могут быть удалены или масштабированы, когда они больше не нужны.

  • Высокая безопасность

    MRS предоставляет корпоративного уровня управление разрешениями в многотенантной среде и управление безопасностью, поддерживая контроль доступа на уровне таблиц и столбцов, а также шифрование данных.

  • Простое O&M

    MRS предоставляет эффективную платформу управления кластерами больших данных, поддерживающую однощёлчковые скользящие обновления патчей, обеспечивая непрерывность ваших сервисов.

  • Высокая надёжность

    Проверенная и доказанная в многочисленных проектах, долгосрочная надёжность и стабильность MRS в масштабных развертываниях может соответствовать корпоративным стандартам для производственных систем. Кроме того, MRS поддерживает автоматическое резервное копирование данных между AZ и регионами, а также автоматическую антиаффинность, позволяя критически важным ВМ распределять на разных физических машинах.