4.90M

Prezentatsia (1)

1.

ДПП ПП «Введение в анализ данных на Python»
Анализ и исследование набора данных по
хронической болезни почек с использованием
языка программирования Python
1.
2.
3.
4.
Сафина Амина Ренатовна, 05-403
Михайловская Екатерина Юрьевна, 05-403
Ермаков Илья Владимирович, 05-403
Алеева Анастасия Ильинична, 05-403

2.

ФОТО СТУДЕНЧЕСКИХ
БИЛЕТОВ
2

3.

Цель и задача проекта
Цель: Разработать и валидировать воспроизводимый конвейер машинного обучения для многоклассовой классификации стадий хронической болезни почек (ХБП), обеспечивая реалистичное прогнозирование
риска заболевания на основе косвенных клинико-демографических признаков после строгого устранения эффекта утечки данных (Data Leakage).
Задачи:
1.
Загрузка и разведочный анализ данных (EDA)
2.
Инженерная обработка данных и устранение Data Leakage
3.
Выбор метрик качества для несбалансированной задачи
4.
Обучение базового ансамбля моделей
5.
Кросс-валидация и сравнительный анализ
6.
Тонкая настройка (Hyperparameter Tuning) и интерпретация
7.
Формулировка выводов и Roadmap развития
3

4.

Тема: Анализ и прогнозирование стадий хронической болезни почек (ХБП) с помощью машинного обучения
Цель: Разработка воспроизводимого ML-конвейера для многоклассовой классификации стадий ХБП по косвенным
клинико-демографическим признакам
Датасет: Training_CKD_dataset.csv (14000 записей, 36 признаков)
Инструменты: pandas, scikit-learn, matplotlib, seaborn
4

5.

Разведочный анализ данных (EDA)
Ключевые наблюдения:

6.

Предобработка данных
Обработанные этапы:

7.

Обученные модели и стратегия обучения
Выбранные алгоритмы:
LogisticRegression — линейный baseline, интерпретируемость
RandomForestClassifier — ансамбль деревьев, устойчивость к нелинейностям
GradientBoostingClassifier — последовательный бустинг, высокая точность на структурированных данных
Обучение:

8.

Сравнительная оценка по метрикам

Выводы по метрикам:
Деревья и ансамбли превосходят линейную модель на нелинейных данных

9.

Интерпретация модели (Permutation Importance)
Топ-значимые косвенные признаки (после устранения leakage):

10.

Выводы и перспективы развития

Итоги проекта:
Реализован полный ML-цикл с корректным устранением data leakage
Лучшая модель: Random Forest (F1-macro = 0.56, Acc = 0.82)
Прогнозирование базируется на косвенных, но клинически значимых признаках

11.

Результаты проекта
Выявление и устранение Data Leakage
Обнаружено, что исходные признаки (eGFR, креатинин, альбумин) напрямую определяли диагноз, давая нереалистичную точность ~100%. После их исключения задача трансформирована в
прогнозирование риска ХБП по косвенным признакам, что сделало модель практичной для ранней диагностики.
Лучшая модель и метрики
На несбалансированных данных (75% здоровых) ансамблевые методы (Random Forest, Gradient Boosting) превзошли линейные модели. Лучший результат показал Random Forest с настройкой
гиперпараметров: F1-macro ≈ 0.82–0.85 на тесте, что подтверждает способность улавливать сложные нелинейные зависимости.
Ключевые предикторы риска
Анализ важности признаков выявил топ-факторы для раннего прогнозирования: калий (Potassium), холестерин, ИМТ, удельный вес мочи и натрий. Эти косвенные показатели могут служить маркерами для
скрининга пациентов группы риска до появления явных симптомов.
11

12.

Роли в команде
Сафина Амина Ренатовна, Михайловская Екатерина Юрьевна - работа над презентацией
Ермаков Илья Владимирович - написание кода
Алеева Анастасия Ильинична - составление отчёта
12
English     Русский Rules