Интеграция Apache Ozone и Argo Workflows
Актуальность темы
Цели и задачи
Проблематика традиционной архитектуры
Apache Ozone
Argo Workflows
Архитектура интегрированного решения
Развертывание Ozone
Развертывание Argo
Методика тестирования
Анализ результатов тестирования
Заключение
Спасибо за внимание!
4.81M

Презентация КомлевАВ БВТ2101 (2)

1. Интеграция Apache Ozone и Argo Workflows

как альтернатива Apache Hadoop
Студент: Комлев Артём Владимирович, гр. БВТ2101
Научный руководитель: Полянцева Ксения Андреевна, к.т.н. доц. кафедры МКиИТ

2. Актуальность темы

Hadoop устарел — нужны
гибкие современные решения
Быстрый рост объёмов данных требует более
масштабируемых и отказоустойчивых решений
Масштабирование Hadoop дорого и неэффективно,
так как хранение и вычисления жёстко связаны
Современные подходы разделяют хранение и
обработку, что упрощает инфраструктуру и снижает
расходы
Объектные хранилища (Ozone) становятся стандартом
для Big Data вместо HDFS
Рост объема данных
200
Объем, ЗБ
150
100
50
0
2010
2012
2014
2016
2018
2020
2022
2024
Контейнеризация и оркестрация (Argo Workflows)
позволяют гибко управлять вычислениями и
автоматизировать процессы
2

3. Цели и задачи

Исследовать и разработать архитектуру распределённой
системы обработки данных на основе Apache Ozone и Argo
Workflows.
Проанализировать существующие подходы к обработке и хранению Big Data
Реализовать развёртывание компонентов и их интеграцию
Провести сравнительный анализ с Hadoop по ключевым метрикам
3

4. Проблематика традиционной архитектуры

Проблемы архитектуры
монолитной системы Hadoop:
Связанное масштабирование хранения и
вычислений
Высокая инфраструктурная стоимость
Сложность сопровождения и обновления
Ограниченная гибкость
4

5. Apache Ozone

Объектная модель хранения данных
Поддерживает S3 API и файловый API
Поддерживает Erasure Coding
Высокий потенциал масштабирования
5

6. Argo Workflows

Почему именно он?
Преимущества
Argo
Интеграция с
Kubernetes
Описание
Нативная работа внутри
Kubernetes, использование
всех его механизмов
Масштабируемость Автоматический запуск
множества задач в
параллельных контейнерах
Простота
развёртывания
Установка через Helm или
kubectl, активное
сообщество и документация
Argo Workflows — это система с
открытым исходным кодом для
построения и оркестрации
вычислительных пайплайнов
(workflows) в среде Kubernetes.
Архитектура Argo:
• Workflow Controller
• Pods
• Argo server
6

7. Архитектура интегрированного решения

Apache Ozone
o Стандартный набор
компонентов
• Хранение
данных
Интеграция
• Обработка
данных
• Передача
данных
Ozone
Argo
o Ambari
o PostgreSQL
Argo Workflows
o Стандартный набор
компонентов
o OpenShift
Интеграция
o Ozone Client
o Spark
7

8. Развертывание Ozone

Этапы разворота:
Установка Ambari Agent на все хосты
будущего кластера
Настройка конфигурационных
файлов ambari-agent.ini
Установка Ambari Server на один из
хостов кластера
Работа с базой данных Postgres
Настройка конфигурационного
файла ambari.properties
Запуск Ambari Blueprint для
установки компонентов на все хосты
8

9. Развертывание Argo

Этапы разворота:
Загрузка Helm-чарта
Создание сервисных аккаунтов
Подготовка конфигурации Helm
через параметры окружения
Установка Helm-релиза
9

10. Методика тестирования

Сценарий 1
Сценарий 2
Сценарий 3
Запись маленьких файлов в Ozone
и Hadoop
Чтение маленьких файлов из
Ozone и Hadoop
Запись средних файлов в Ozone и
Hadoop
Сценарий 4
Сценарий 5
Чтение средних файлов из Ozone
и Hadoop
Реальная нагрузка, включающая
чтение, фильтрацию, агрегацию и
запись результатов
10

11. Анализ результатов тестирования

Среднее
Среднее время
Метрика
Hadoop
Ozone + Argo
время записи
записи для 20Мб,
Объем файла, ГБ
1
1
для 1 Кб, мс
мс
Кол-во строк
~ 5 000 000
~ 5 000 000
Hadoop
450
2948
Общее время
48.2
50.6
Ozone + Argo
461
2919
3.2
6.7
Время чтения, сек
9.5
9.3
Время обработки, сек
26.7
25.5
Время записи, сек
8.8
9.1
Система
выполнения, сек
Время запуска Spark
Система
Среднее
Среднее время
время чтения
чтения для 20Мб,
для 1 Кб, мс
мс
Hadoop
20
458
Ozone + Argo
26
381
job, сек
11

12. Заключение

В рамках выпускной квалификационной работы была достигнута основная цель —
разработана интегрированная система хранения и обработки больших данных на базе
Apache Ozone и Argo Workflows.
Проведён анализ современных технологий и ограничений Apache Hadoop
Обоснована необходимость разделения хранения и вычислений в Big Data-системах
Изучены архитектуры и возможности Apache Ozone и Argo Workflows
Развёрнуты кластеры хранения и оркестрации, автоматизировано их развёртывание.
Проработана схема интеграции компонентов
• Проведено тестирование производительности и сравнение с Hadoop
Предложенное решение обеспечивает гибкость, масштабируемость, отказоустойчивость и
снижение затрат, и может быть использовано как в исследовательских, так и в прикладных
системах хранения и обработки больших данных.
12

13. Спасибо за внимание!

Комлев Артём Владимирович, БВТ2101
English     Русский Rules