При построении поисково‑аналитической платформы корпоративного уровня может потребоваться загрузить большие объёмы разнородных данных, распределённых по реляционным базам данных (например MySQL и Oracle), системам обмена сообщениями (например Kafka), сервисам объектного хранилища (например OBS) и бизнес‑приложениям в кластер Elasticsearch. Чтобы удовлетворить различные требования к задержке данных, объёму данных и затратам на разработку, CSS Elasticsearch clusters предоставляют несколько методов загрузки данных. В этом разделе кратко представлены и сравниваются эти методы, их применимые сценарии и характеристики, чтобы помочь выбрать оптимальный вариант.
Перед загрузкой больших объёмов данных вы можете повысить производительность загрузки целевого кластера Elasticsearch, чтобы увеличить пропускную способность. Подробнее см. Enhancing Data Ingestion Performance.
Метод | Когда использовать | Поддерживаемые источники/форматы | Подробности |
|---|---|---|---|
Cloud Data Migration (CDM) | Необходимо выполнить полную миграцию исторических данных. Этот метод не требует написания кода и управляется пошаговым мастером. Например, вы можете загрузить многолетние архивные журналы из OBS или исторические заказы из Oracle в Elasticsearch. | OBS (JSON/CSV), Oracle, and MySQL | |
Open-source Logstash | Вы хотите перенести данные из локального IDC в кластеры Elasticsearch в облаке, при этом можете использовать специальные плагины или глубоко настроенную логику конвейера. Например, вы можете загружать системные логи из локального дата‑центра в Elasticsearch через SSH‑туннель. | Любой источник, поддерживаемый входом Logstash, например JSON, CSV и текст | |
Open-source API | Вам необходимо быстро записывать небольшие объёмы данных в Elasticsearch во время разработки или отладки. Например, вы можете позволить Java/Python‑приложениям напрямую вызывать Elasticsearch APIs для записи данных. | JSON |