Similar presentations:
Презентация КомлевАВ БВТ2101 (2)
1. Интеграция Apache Ozone и Argo Workflows
как альтернатива Apache HadoopСтудент: Комлев Артём Владимирович, гр. БВТ2101
Научный руководитель: Полянцева Ксения Андреевна, к.т.н. доц. кафедры МКиИТ
2. Актуальность темы
Hadoop устарел — нужныгибкие современные решения
Быстрый рост объёмов данных требует более
масштабируемых и отказоустойчивых решений
Масштабирование Hadoop дорого и неэффективно,
так как хранение и вычисления жёстко связаны
Современные подходы разделяют хранение и
обработку, что упрощает инфраструктуру и снижает
расходы
Объектные хранилища (Ozone) становятся стандартом
для Big Data вместо HDFS
Рост объема данных
200
Объем, ЗБ
150
100
50
0
2010
2012
2014
2016
2018
2020
2022
2024
Контейнеризация и оркестрация (Argo Workflows)
позволяют гибко управлять вычислениями и
автоматизировать процессы
2
3. Цели и задачи
Исследовать и разработать архитектуру распределённойсистемы обработки данных на основе Apache Ozone и Argo
Workflows.
Проанализировать существующие подходы к обработке и хранению Big Data
Реализовать развёртывание компонентов и их интеграцию
Провести сравнительный анализ с Hadoop по ключевым метрикам
3
4. Проблематика традиционной архитектуры
Проблемы архитектурымонолитной системы Hadoop:
Связанное масштабирование хранения и
вычислений
Высокая инфраструктурная стоимость
Сложность сопровождения и обновления
Ограниченная гибкость
4
5. Apache Ozone
Объектная модель хранения данныхПоддерживает S3 API и файловый API
Поддерживает Erasure Coding
Высокий потенциал масштабирования
5
6. Argo Workflows
Почему именно он?Преимущества
Argo
Интеграция с
Kubernetes
Описание
Нативная работа внутри
Kubernetes, использование
всех его механизмов
Масштабируемость Автоматический запуск
множества задач в
параллельных контейнерах
Простота
развёртывания
Установка через Helm или
kubectl, активное
сообщество и документация
Argo Workflows — это система с
открытым исходным кодом для
построения и оркестрации
вычислительных пайплайнов
(workflows) в среде Kubernetes.
Архитектура Argo:
• Workflow Controller
• Pods
• Argo server
6
7. Архитектура интегрированного решения
Apache Ozoneo Стандартный набор
компонентов
• Хранение
данных
Интеграция
• Обработка
данных
• Передача
данных
Ozone
Argo
o Ambari
o PostgreSQL
Argo Workflows
o Стандартный набор
компонентов
o OpenShift
Интеграция
o Ozone Client
o Spark
7
8. Развертывание Ozone
Этапы разворота:Установка Ambari Agent на все хосты
будущего кластера
Настройка конфигурационных
файлов ambari-agent.ini
Установка Ambari Server на один из
хостов кластера
Работа с базой данных Postgres
Настройка конфигурационного
файла ambari.properties
Запуск Ambari Blueprint для
установки компонентов на все хосты
8
9. Развертывание Argo
Этапы разворота:Загрузка Helm-чарта
Создание сервисных аккаунтов
Подготовка конфигурации Helm
через параметры окружения
Установка Helm-релиза
9
10. Методика тестирования
Сценарий 1Сценарий 2
Сценарий 3
Запись маленьких файлов в Ozone
и Hadoop
Чтение маленьких файлов из
Ozone и Hadoop
Запись средних файлов в Ozone и
Hadoop
Сценарий 4
Сценарий 5
Чтение средних файлов из Ozone
и Hadoop
Реальная нагрузка, включающая
чтение, фильтрацию, агрегацию и
запись результатов
10
11. Анализ результатов тестирования
СреднееСреднее время
Метрика
Hadoop
Ozone + Argo
время записи
записи для 20Мб,
Объем файла, ГБ
1
1
для 1 Кб, мс
мс
Кол-во строк
~ 5 000 000
~ 5 000 000
Hadoop
450
2948
Общее время
48.2
50.6
Ozone + Argo
461
2919
3.2
6.7
Время чтения, сек
9.5
9.3
Время обработки, сек
26.7
25.5
Время записи, сек
8.8
9.1
Система
выполнения, сек
Время запуска Spark
Система
Среднее
Среднее время
время чтения
чтения для 20Мб,
для 1 Кб, мс
мс
Hadoop
20
458
Ozone + Argo
26
381
job, сек
11
12. Заключение
В рамках выпускной квалификационной работы была достигнута основная цель —разработана интегрированная система хранения и обработки больших данных на базе
Apache Ozone и Argo Workflows.
Проведён анализ современных технологий и ограничений Apache Hadoop
Обоснована необходимость разделения хранения и вычислений в Big Data-системах
Изучены архитектуры и возможности Apache Ozone и Argo Workflows
Развёрнуты кластеры хранения и оркестрации, автоматизировано их развёртывание.
Проработана схема интеграции компонентов
• Проведено тестирование производительности и сравнение с Hadoop
Предложенное решение обеспечивает гибкость, масштабируемость, отказоустойчивость и
снижение затрат, и может быть использовано как в исследовательских, так и в прикладных
системах хранения и обработки больших данных.
12