Облачная платформаAdvanced

Преимущества MRS по сравнению с собственными кластерами Hadoop

Язык статьи: Русский
Показать оригинал
Страница переведена автоматически и может содержать неточности. Рекомендуем сверяться с английской версией.

MRS предоставляет кластеры больших данных корпоративного уровня в облаке. Тенанты могут полностью контролировать кластеры и без труда запускать компоненты больших данных, такие как Hadoop, Spark, HBase, Kafka и Storm. MRS освобождает вас от покупки и обслуживания оборудования. MRS построен на базе корпоративной платформы больших данных FusionInsight и развернут на десятках тысяч узлов в отрасли, обеспечивая многоуровневую гарантию SLA с поддержкой профессионального сервиса ядра Hadoop. По сравнению с собственными кластерами Hadoop, MRS имеет следующие преимущества:

  1. MRS поддерживает однокнопочное создание, удаление и масштабирование кластера. Вы можете использовать elastic IP address (EIP) для доступа к MRS Manager, делая кластеры больших данных более удобными в использовании.
    • Самостоятельно построенные кластеры больших данных вызывают проблемы, такие как высокие затраты, длительные сроки, сложное и негибкое O&M. Для решения этих проблем MRS предоставляет однокнопочное создание, удаление, scale-out и scale-in кластера, позволяя настраивать тип кластера, набор компонентов, количество узлов каждого типа, спецификации VM, зоны доступности (AZs), сеть VPC и данные аутентификации. MRS может автоматически создать кластер, соответствующий требованиям конфигурации. Кроме того, вы можете быстро создавать многоприложные кластеры, например, кластер анализа Hadoop, кластер HBase и кластер Kafka. MRS поддерживает развертывание гетерогенных кластеров. То есть VM с различными спецификациями могут комбинироваться в кластере на основе типов CPU, ёмкостей дисков, типов дисков и размеров памяти.
    • MRS предоставляет защищённый канал на основе EIP, позволяющий легко получать доступ к web UI компонентов. Это удобнее, чем привязывать EIP самостоятельно, и вы можете получить доступ к web UI несколькими щелчками, избегая шагов входа в VPC, добавления правил security group и получения public IP address.
    • MRS предоставляет пользовательские bootstrap actions для гибкой настройки ваших выделенных кластеров. Стороннее программное обеспечение, не поддерживаемое MRS, может устанавливаться автоматически, позволяя выполнять пользовательские операции, такие как изменение среды выполнения кластера.
    • MRS поддерживает функцию WrapperFS, предоставляет возможность трансляции OBS (то есть доступ к OBS через сопоставление адресов) и может плавно мигрировать данные из HDFS в OBS. После миграции вы можете получать доступ к данным, хранящимся в OBS, из клиентов без изменения логики кода сервиса.
  2. MRS поддерживает auto scaling, что более экономично, чем собственный кластер Hadoop.

    MRS поддерживает auto scaling для обработки пиковых и непиковых нагрузок сервиса. Он запрашивает дополнительные ресурсы в часы пика и освобождает неиспользуемые ресурсы в часы непика, помогая экономить неиспользуемые ресурсы на платформе больших данных в непиковое время, минимизировать затраты и сосредоточиться на core services.

    В приложениях больших данных, особенно при периодическом анализе и обработке данных, ресурсы вычислений кластера необходимо динамически регулировать в зависимости от изменений данных сервиса для удовлетворения требований сервиса. Функция auto scaling в MRS позволяет эластично масштабировать кластеры наружу или внутрь в зависимости от нагрузок кластера. Кроме того, если объём данных меняется регулярно и вы хотите масштабировать кластер до изменения объёма данных, можно использовать функцию resource plan в MRS. MRS поддерживает два типа политик auto scaling: auto scaling rules и resource plans.

    • Auto scaling rules: Вы можете увеличивать или уменьшать узлы Task в зависимости от реальных нагрузок кластера. Auto scaling будет запускаться при изменении объёма данных, но может наблюдаться некоторая задержка.
    • Resource plans: Если объём данных меняется периодически, вы можете создавать resource plans для изменения размера кластера до изменения объёма данных, тем самым избегая задержки при увеличении или уменьшении ресурсов.

    И auto scaling rules, и resource plans могут инициировать auto scaling. Вы можете настроить оба варианта или только один из них. Настройка одновременно resource plans и auto scaling rules повышает масштабируемость узлов кластера для обработки иногда неожиданных пиков объёма данных.

  3. MRS поддерживает storage-compute decoupling, значительно повышая эффективность использования ресурсов кластеров больших данных.

    В традиционной архитектуре больших данных, где ресурсы хранения и вычислений интегрированы, масштабирование наружу затруднено, а ресурсы неэффективно используются. Чтобы решить эти проблемы, MRS применяет архитектуру разделения вычислений и хранения. На основе OBS хранилище достигает надёжности 99.999999999% и неограниченной ёмкости, поддерживая непрерывный рост данных предприятия. Вычислительные ресурсы могут эластично масштабироваться внутрь или наружу от 0 до N узлов. Сотни узлов могут быть быстро развернуты. С новой архитектурой вычислительные узлы могут масштабироваться эластично. Хранилище данных на основе OBS с кросс-AZ обеспечивает более высокую надёжность, освобождая от беспокойства о чрезвычайных ситуациях, таких как землетрясения и обрывы оптоволокна. Ресурсы хранения и вычислений могут гибко настраиваться и эластично масштабироваться по требованию. Это делает распределение ресурсов более точным и обоснованным, значительно повышая эффективность использования ресурсов кластеров больших данных и снижая общие затраты на анализ на 50%.

    Кроме того, архитектура высокопроизводительного разделения вычислений и хранилища снимает ограничение параллельных вычислений интегрированной архитектуры вычислений и хранилища. Она максимизирует высокую пропускную способность и высокую конкурентность OBS и оптимизирует эффективность доступа к данным и глубокие параллельные вычисления (например, операции с метаданными и оптимизацию алгоритма записи), чтобы повысить производительность.

  4. MRS поддерживает собственные разработки CarbonData и Superior Scheduler, обеспечивая более высокую производительность.
    • MRS поддерживает собственную технологию хранения CarbonData. CarbonData — это высокопроизводительное решение для хранения больших данных. Оно позволяет одному набору данных применяться в нескольких сценариях и поддерживает такие функции, как многоуровневое индексирование, словарное кодирование, предварительная агрегация, динамическое разбиение и квазиреальное время запросов к данным. Это улучшает производительность сканирования ввода‑вывода и вычислений и возвращает результаты анализа десятков миллиардов записей данных за секунды.
    • Кроме того, MRS поддерживает собственный Superior Scheduler, который повышает масштабируемость отдельного кластера и способен планировать более 10 000 узлов в кластере. Superior Scheduler — это движок планирования, разработанный для распределённой системы управления ресурсами Hadoop YARN. Это высокопроизводительный и корпоративного уровня планировщик, предназначенный для конвергентных пулов ресурсов и требований многопользовательских сервисов. Superior Scheduler реализует все функции открытых планировщиков Fair Scheduler и Capacity Scheduler. По сравнению с открытыми планировщиками, Superior Scheduler улучшен в политике планирования ресурсов для корпоративных многопользовательских сред, изоляции и совместном использовании ресурсов несколькими пользователями в одном тенанте, производительности планирования, использовании системных ресурсов и масштабируемости кластера, и предназначен для замены открытых планировщиков.
  5. MRS поддерживает несколько режимов изоляции и многопользовательское управление разрешениями для корпоративных больших данных, обеспечивая более высокий уровень безопасности.
    • MRS поддерживает развертывание ресурсов и изоляцию физических ресурсов в выделенных зонах. Вы можете гибко комбинировать вычислительные и хранилищные ресурсы, например выделенные вычислительные ресурсы + общие ресурсы хранилища, общие вычислительные ресурсы + выделенные ресурсы хранилища и выделенные вычислительные ресурсы + выделенные ресурсы хранилища. Кластер MRS поддерживает несколько логических тенантов. Изоляция разрешений позволяет разделять вычислительные, хранилищные и табличные ресурсы кластера по тенантам.
    • С аутентификацией Kerberos MRS предоставляет управление доступом на основе ролей (RBAC) и надёжные функции аудита.
    • Доказано, что при взаимосвязи Host Security Service (HSS) с MRS безопасность сервиса повышается без ухудшения функций и производительности.
    • MRS поддерживает единый вход пользователей через веб‑интерфейс. Менеджер обеспечивает аутентификацию пользователей, предоставляя вам разрешение на доступ к кластеру.
    • MRS поддерживает шифрование хранения данных, зашифрованное хранение всех учётных записей пользователей и паролей, зашифрованную передачу каналов данных и двунаправленную сертификатную аутентификацию для доступа к данным сервисных модулей между доверенными зонами.
    • Кластеры больших данных MRS предоставляют полное многопользовательское решение для корпоративных больших данных. Многопользовательский режим подразумевает набор нескольких ресурсов (каждый набор ресурсов является тенантом) в кластере больших данных MRS. Он может распределять и планировать ресурсы, включая вычислительные и хранилищные ресурсы. Многопользовательский режим изолирует ресурсы кластера больших данных в наборы ресурсов. Пользователи могут арендовать нужные наборы ресурсов для запуска приложений и джоб и хранения данных. В кластере больших данных может быть развернуто несколько наборов ресурсов для удовлетворения разнообразных требований множества пользователей.
    • MRS поддерживает управление корпоративными проектами. Корпоративный проект — один из способов управления облачными ресурсами. Enterprise Management предоставляет комплексные услуги управления для корпоративных клиентов, такие как облачные ресурсы, персонал, разрешения и финансовый статус. Обычные консоли управления ориентированы на контроль и конфигурацию отдельных облачных продуктов. Консоль Enterprise Management, напротив, более сфокусирована на управлении ресурсами. Она предназначена для помощи предприятиям в управлении облачными ресурсами, персоналом, разрешениями и финансами в иерархическом порядке, например управлением компаний, отделов и проектов. MRS позволяет пользователям, включившим Enterprise Project Management Service (EPS), настраивать корпоративные проекты для кластера при его создании и использовать EPS для группового управления ресурсами MRS. Эта функция применима в сценариях, когда необходимо управлять несколькими ресурсами группами и выполнять операции, такие как контроль разрешений и запросы по оплате на основе проектов в корпоративных проектах.
  6. MRS реализует HA для всех узлов управления и поддерживает комплексный механизм надёжности, повышая общую надёжность системы.

    На основе открытого программного обеспечения Apache Hadoop MRS оптимизирует и повышает надёжность основных компонентов сервиса.

    • HA для всех узлов управления

      В открытой версии Hadoop данные и вычислительные узлы управляются в распределённой системе, в которой единая точка отказа (SPOF) не влияет на работу всей системы. Однако SPOF может возникнуть на управляющих узлах, работающих в централизованном режиме, что становится слабым местом общей надёжности системы.

      MRS предоставляет аналогичные механизмы двойных узлов для всех управляющих узлов компонентов сервиса, таких как Manager, Presto, HDFS NameNodes, Hive Servers, HBase HMasters, YARN Resource Managers, Kerberos Servers и Ldap Servers. Все они развернуты в режиме active/standby или сконфигурированы с распределением нагрузки, эффективно предотвращая влияние SPOFs на надёжность системы.

    • Комплексный механизм надёжности

      По результатам анализа надёжности предоставляются следующие меры по обработке программных и аппаратных исключений для повышения надёжности системы:

      • После восстановления питания сервисы работают корректно независимо от отключения питания отдельного узла или всего кластера, обеспечивая надёжность данных в случае непредвиденных отключений электроэнергии. Ключевые данные не будут потеряны, если только жёсткий диск не повреждён.
      • Проверки состояния здоровья и обработка отказов жёсткого диска не влияют на сервисы.
      • Отказы файловой системы могут обрабатываться автоматически, и затронутые сервисы могут автоматически восстанавливаться.
      • Отказы процессов и узлов могут обрабатываться автоматически, и затронутые сервисы могут автоматически восстанавливаться.
      • Отказы сети могут обрабатываться автоматически, и затронутые сервисы могут автоматически восстанавливаться.
  7. MRS предоставляет визуализированный интерфейс управления кластером больших данных в едином виде, упрощая O&M.
    • В интерфейсе управления кластером больших данных доступны запуск и остановка сервисов, изменение конфигурации и проверка состояния здоровья. MRS также предоставляет визуализированные и удобные функции управления кластером, мониторинга и оповещения. Кроме того, вы можете проверить и проаудировать состояние здоровья системы одним щелчком, обеспечивая нормальную работу системы и снижая затраты на O&M.
    • После настройки Simple Message Notification (SMN) MRS может отправлять информацию о состоянии здоровья кластера в реальном времени, включая изменения кластера и сигналы тревоги компонентов, вам через SMS‑сообщения или электронную почту, облегчая O&M, мониторинг в реальном времени и отправку тревог в реальном времени.
    • MRS поддерживает скользящее обновление патчей и предоставляет визуализированную информацию о выпуске патчей и установку патчей в один клик без ручного вмешательства, обеспечивая долгосрочную стабильность кластеров пользователей.
    • Если при использовании кластера MRS возникает проблема, вы можете инициировать авторизацию O&M в консоли управления MRS. Сотрудники O&M могут помочь быстро локализовать проблему, и вы можете отозвать авторизацию в любой момент. Вы также можете инициировать совместное использование журналов в консоли управления MRS, чтобы поделиться указанным диапазоном журналов с сотрудниками O&M, чтобы они могли локализовать неисправности без доступа к кластеру.
    • MRS поддерживает выгрузку журналов о сбоях при создании кластера в OBS, чтобы сотрудники O&M могли получить и проанализировать журналы.
  8. MRS имеет открытую экосистему и поддерживает Прозрачную связанность с периферийными сервисами, позволяя быстро построить унифицированную платформу больших данных.
    • На основе MRS, сервиса полного стека больших данных, предприятия могут построить унифицированную платформу больших данных для загрузки, хранения, анализа и добычи ценности данных одним щелчком, а также взаимосвязываться с DataArts Studio и сервисами визуализации данных, чтобы помочь клиентам легко перенести данные в облако, разрабатывать и планировать задачи больших данных и отображать данные. Это освобождает клиентов от сложного построения платформы больших данных и профессиональной калибровки и обслуживания больших данных, позволяя им сосредоточиться больше на отраслевых приложениях и использовать одну копию данных в нескольких сценариях обслуживания. DataArts Studio — это универсальная платформа разработки жизненного цикла данных, предоставляющая широкий спектр функций, таких как интеграция данных, разработка, управление, обслуживание и визуализация. Данные MRS могут быть загружены в DataArts Studio для совместной визуализированной разработки одним щелчком, используя визуализированный GUI DataArts Studio, обширные типы разработки данных (скрипт и задача), полностью размещённое планирование задач и мониторинг O&M, а также встроенные отраслевые конвейеры обработки данных. Это делает работу с большими данными гораздо проще, помогает быстро построить центры обработки больших данных и обеспечивает быструю монетизацию.
    • MRS полностью совместим с открытой экосистемой больших данных с открытым исходным кодом. Благодаря обширным инструментам миграции данных и приложений, MRS помогает быстро перенести данные с ваших собственных платформ без изменения кода и прерывания обслуживания.