Similar presentations:
Математические методы обработки и анализа пространственных данных
1. Математические методы обработки и анализа пространственных данных
Злоников Роман Русланович,преподаватель кафедры
информатики и
геоинформационных технологий
2. Раздел 3. Инструменты и статистики исследовательского анализа пространственных данных
Раздел 3. Инструментыи статистики исследовательского
анализа пространственных данных
3. Тема 1. Введение в исследовательский анализ пространственных данных, описательную статистику, статистику выводов и
пространственную статистику4.
Ключевые определенияИсследовательский анализ пространственных данных (Exploratory Spatial Data
Analysis, ESDA) – это набор вычислительных методов и методов визуализации,
используемых для анализа пространственных данных путем:
• применения классической непространственной описательной статистики,
обеспечивающей динамическую связь с картами ГИС и пространственными объектами;
• выявления пространственных взаимодействий, отношений и закономерностей с
использованием матрицы пространственных весов (определяемой соответствующим
методом концептуализации), проверкой гипотез и различных показателей.
Методы и инструменты ESDA используются для:
• описания и обобщения распределения пространственных данных;
• визуализации пространственного распределения;
• изучения пространственной автокорреляции (пространственных отношений и связей);
• выявления пространственных выбросов;
• выявления кластеров;
• определения "горячих" и "холодных" точек.
4
5.
Ключевые определенияОписательная статистика – это набор статистических процедур,
обобщающих основные характеристики распределения посредством
вычисления и построения:
• распределения частот;
• центра, рассеяния и формы (среднее, медиана и стандартное
отклонение);
• стандартной ошибки;
• процентилей и квартилей;
• выбросов;
• коробчатых диаграмм;
• нормального графика КК.
5
6.
Ключевые определенияСтатистика выводов – это раздел статистики, специализирующийся на
анализе образцов для формирования выводов обо всей генеральной
совокупности.
Пространственная статистика использует статистические методы для
анализа пространственных данных, количественной оценки
пространственных процессов, выявления скрытых или неожиданных
закономерностей и моделирования данных в географическом контексте.
Пространственная статистика в значительной степени основана на
статистике выводов и проверке гипотез для анализа закономерностей, что
позволяет точнее моделировать пространственные явления.
В отличие от непространственных методов, пространственная статистика в
своих математических формулах использует пространственные свойства,
такие как местоположение, расстояние, площадь, длина и близость.
Пространственная статистика количественно определяет и дополнительно
отображает то, что человеческий глаз и разум интуитивно видят при чтении
карты, отражающей пространственное расположение, распределение,
процессы или тенденции.
6
7.
Назначение описательной статистики и ESDAОбычно первой задачей любого анализа является описание набора данных. Это
позволяет быстро понять, как изменяются данные, и определить возможные ошибки
(например, неприемлемые значения, пропуски или выбросы). Для описания набора
данных мы используем описательную статистику (или "сводную статистику").
Вот типичные вопросы, на которые может ответить описательная статистика в
географическом контексте:
• Какова величина среднего дохода в данной области?
• Какой процент людей имеет высшее образование в данной области?
• Сколько клиентов конкретного кафе живут в пределах 10 минут ходьбы?
• Каковы их покупательная способность и величина стандартного отклонения в их
доходах?
Описательная статистика применяется для вычисления конкретных характеристик
(например, среднего или стандартного отклонения), что позволяет получить представление
о распределении данных. Однако эти характеристики не отражают связей между
результатами и пространственными объектами на карте.
В основе исследовательского анализа пространственных данных лежит понятие
пространственной автокорреляции, согласно которой более близкие пространственные
объекты имеют более похожие значения (в одном или нескольких атрибутах). ESDA
предлагает более мощные возможности, обнаруживая закономерности в данных
посредством картирования и статистической проверки гипотез.
7
8.
Назначение описательной статистики и ESDAСила исследовательского анализа пространственных данных (ESDA) основывается на двух
основных характеристиках:
• Извлекает знания благодаря возможностям интеллектуального анализа данных –
информация, которую несут значения атрибутов, имеет отношение к местоположению. Это
особенно важно в отсутствие теоретической основы, например в междисциплинарных
областях социальных наук.
• Использует широкий спектр графических методов в сочетании с картированием, что делает
анализ более доступным для людей, не привыкших к построению моделей.
Описательная статистика всегда используется в комбинации с инструментами ESDA. Иногда эти
две области имеют размытые границы, по крайней мере это особенно верно в отношении
простых инструментов. По этой причине в одних книгах гистограммы, диаграммы разброса или
коробчатые диаграммы относятся авторами к описательной статистике, а в других - к
исследовательскому анализу пространственных данных. Различия между ними не имеют
большого значения, пока исследователь понимает, как работает каждый инструмент. По сути,
единственное отличие простых инструментов ESDA (например, гистограмм, диаграмм
рассеяния, коробчатых диаграмм) состоит в возможности связывать графики с
пространственными объектами, что способствует их использованию в исследовательском
анализе.
Вообще говоря, простые инструменты ESDA можно использовать до этапа моделирования, а
расширенные инструменты ESDA – на этапе построения модели для выявления
пространственных отношений и скрытых закономерностей в пространственных данных.
8
9.
Назначение пространственной статистикиПространственную статистику можно рассматривать как часть коллекции методов
пространственного анализа, таких как исследовательский анализ
пространственных данных (ESDA), пространственный анализ точечных
закономерностей, пространственная кластеризация и пространственная
эконометрика.
Пространственная статистика в основном используется для:
• анализа географического распределения с помощью центрографических
измерений;
• анализа пространственных закономерностей;
• определения пространственной автокорреляции, горячих точек и выбросов;
• выполнения пространственной кластеризации;
• моделирования пространственных отношений;
• анализа пространственно-непрерывных переменных, таких как температура,
уровень загрязнения, мощность почвенно-растительного слоя и т.д.
9
10.
Назначение пространственной статистикиПространственная статистика основана на статистических понятиях, но включает
определение местоположения в терминах географических координат, расстояния и
площади. Она дополняет классические статистические измерения и процедуры и
предлагает расширенные возможности анализа данных.
В географическом анализе классическая и пространственная статистики
используются вместе, дополняя друг друга. Однако между классической и
пространственной статистиками есть принципиальная разница. В классической
статистике мы делаем следующее предположение относительно выборки: это
набор независимых наблюдений, которые следуют определенному распределению,
обычно нормальному. В пространственной статистике, напротив, из-за присущей
пространственной зависимости и существования пространственной
автокорреляции основное внимание уделяется методам выявления и описания
этих зависимостей и корреляций. Иначе говоря, в классической статистике
наблюдения должны быть независимыми, тогда как в пространственной
статистике между наблюдениями обычно имеется пространственная зависимость.
Классическая статистика должна быть изменена, чтобы учесть это условие.
10
11. Тема 2. Простые инструменты ESDA и описательные статистики для визуализации пространственных данных (одномерные данные)
Тема 2. Простые инструментыESDA и описательные статистики
для визуализации
пространственных данных
(одномерные данные)
12.
Фоновые картограммыФоновые картограммы (хороплеты) — это тематические карты, на которых оформление отображаемых
областей зависит от значения соответствующей переменной.
Фоновые картограммы помогают получить графическое представление пространственного распределения
значений конкретной переменной по изучаемой области.
Первая задача при объединении пространственных данных с непространственными (например, с данными
переписи) — их отображение, создание картограмм. Например, численность населения, плотность
населения и доход на душу населения можно отобразить на карте.
На фоновых картограммах отображаются две основные категории переменных:
• Пространственно-экстенсивные переменные — отображение каждого полигона выбирается в
зависимости от измеренного значения, которое справедливо для всего полигона (например, общая
численность населения, общее число домохозяйств).
• Пространственно-интенсивные переменные — значения нормируются по площади или другой
переменной (например, плотность населения, доход на душу населения, уровень безработицы).
Предпочтительнее использовать переменные из второй категории, поскольку полигоны на карте имеют
разные размеры и прямое сопоставление фактических значений может вводить в заблуждение. Например,
очень маленький и очень большой полигоны с одинаковой численностью населения будут отображаться
одним цветом при отображении абсолютных значений. Однако при отображении плотности населения эти
же полигоны будут показаны разным цветом из-за сильно отличающихся значений плотности. Выбор типа
переменной для создания фоновой картограммы зависит от задачи и того, что мы собираемся сообщить с
ее помощью.
С помощью фоновых картограмм можно визуально определить места группировки значений и наличие
схожих пространственных закономерностей. Картограмма не отображает статистик, но может многое
рассказать. Однако научный анализ всегда должен сопровождаться статистическим анализом,
подтверждающим надежность результатов.
12
13.
Распределение частот и гистограммыОпределение
Таблица распределения частот — это таблица, в которой хранятся категории, частоты,
относительные частоты и накопленная частота одной непрерывной интервальной переменной.
Частота конкретной категории или значения переменной (также называется «наблюдением») —
это количество появлений категории или значения в наборе данных.
Относительная частота — это доля (%) наблюдений, относящихся к данной категории.
Используется для понимания, как выборка или совокупность распределяется по категориям
(вычисляется как: относительная частота = частота / n).
Накопленная частота в каждой строке получается сложением относительной частоты в этой строке
с накопленной частотой в строке выше. Она сообщает, какой процент населения (наблюдений)
попадает в этот интервал. Накопленная частота в последней строке должна быть равна 100%.
13
14.
Распределение частот и гистограммыГистограмма частотного распределения —
это гистограмма, в которой по оси X
откладываются категории, а по оси Y — частоты
(относительные частоты) одной непрерывной
интервальной переменной.
Гистограмма плотности вероятности
определяется так, что:
• площадь каждого столбика равна
относительной частоте (вероятности)
соответствующего интервала;
• общая площадь гистограммы равна 1.
В общем случае любое распределение можно
описать тремя важными характеристиками:
центром, рассеянием и формой. Анализ этих
характеристик дает информацию о: центре,
протяженности, общей форме, местоположении
и количестве пиков и наличии пропусков и
выбросов.
14
15.
Распределение частот и гистограммыТаблицы распределения и гистограммы частот используются для анализа распределения значений
изучаемой переменной по различным категориям. Гистограмма также позволяет определить,
является распределение нормальным или нет. Кроме того, ее можно использовать для отображения
формы и изучения статистических свойств распределения (например, среднего значения,
асимметрии, эксцесса).
Они также позволяют найти ответы на важные вопросы, которые могут помочь в пространственном
анализе или пространственном планировании (например, сколько округов имеют население
меньше определенного количества). Гистограммы не следует путать с коробчатыми диаграммами,
которые используются в основном для отображения номинальных или порядковых данных.
Перед вычислением частот необходимо выбрать количество интервалов для группировки
значений, делящих весь диапазон значений. Выбор наилучшего количества интервалов зависит от
поставленной задачи и целей анализа; это число должно быть осмысленным. Большое количество
интервалов оправдано для больших выборок, характеризующихся большой дисперсией, но
слишком большое число интервалов затрудняет интерпретацию. С другой стороны, маленькое
количество интервалов может скрывать изменчивость данных. Как показывает практика, значение,
попадающее на границу двух интервалов, предпочтительнее относить к верхнему интервалу.
После определения интервалов нужно подсчитать, сколько значений (наблюдений) попадает в
каждый из них. Это количество и есть частота. Если сложить все частоты, должна получиться
сумма, равная размеру выборки (n). Таблица распределения частот также включает относительную
частоту (процент) и накопленную частоту (накопленный процент). Сумма всех относительных
частот должна быть равна 100%.
15
16.
Распределение частот и гистограммыНа основе таблицы распределения частот можно построить гистограмму частотного
распределения. На этой гистограмме каждая частота относится к соответствующему
интервалу и представлена прямоугольником. Для интервалов одинаковой ширины
площади прямоугольников будут пропорциональны соответствующим частотам.
Также можно строить гистограммы для относительных частот. Каждый столбик в
такой гистограмме соответствует тем же интервалам на оси X, что и в гистограмме
частотного распределения, но их высота равна относительной частоте. При этом
сумма высот всех столбиков равна 1. Относительную частоту можно рассматривать как
вероятность появления значения из этого интервала.
Еще один способ визуализации — нормализовать (разделить) относительную частоту
шириной каждого интервала. В этом случае на оси Y откладывается относительная
частота, а на оси X — фактические значения переменной. Гистограммы этого типа
называют гистограммами плотности вероятности. В этом случае интервалы имеют
разную ширину. Площадь каждого столбика равна вероятности появления
определенного значения или диапазона значений, а площадь всех интервалов должна
быть равна 1. С увеличением размера выборки для того же диапазона значений
создается все больше интервалов. В результате гистограмму плотности можно
аппроксимировать непрерывной функцией, которую называют "функцией плотности
вероятности".
16
17.
Распределение частот и гистограммыФункция плотности вероятности для
нормального распределения принимает два
параметра: среднее значение и стандартное
отклонение. В случае нормального
распределения ожидается, что 68% значений
будут находиться на расстоянии не более
одного стандартного отклонения от среднего
и 95% значений — на расстоянии не более
двух стандартных отклонений (в обоих
направлениях). Площадь под кривой в
определенном интервале равна вероятности
появления значений из набора данных,
попадающих в этот интервал. Например,
вероятность попадания значения в диапазон
от +1 до +2 стандартных отклонений в
нормальном распределении составляет 13,5%.
Ожидается, что количество значений,
которые больше суммы среднего и двух
стандартных отклонений, не превысит 2,5%.
Иначе говоря, вероятность получить
значение, которое больше суммы среднего и
двух стандартных отклонений, составляет
менее 2,5%. Аналогично ожидается, что
количество значений, которые меньше
разности среднего и двух стандартных
отклонений, также составляет менее 2,5%.
17
18.
Распределение частот и гистограммыНекоторые критерии значимости, часто
применяемые в пространственной статистике для
проверки гипотезы путем вычисления
вероятности попадания в определенный
интервал (уровня значимости), используют
функцию нормального распределения.
Нормальное распределение (его также называют
распределением Гаусса) особенно широко
используется в статистике, потому что многие
физические явления имеют нормальное
распределение (например, вес и рост человека).
Нормально распределенные значения
переменной с большей вероятностью будут
располагаться ближе к среднему, а очень
большие или маленькие значения будут иметь
низкую вероятность появления.
Стандартное нормальное распределение имеет
нулевое среднее значение, единичное
стандартное отклонение, симметричную форму и
колоколообразный вид. Однако не все
колоколообразные гистограммы представляют
нормальное распределение, поскольку
нормальное распределение характеризуется
определенной скоростью убывания плотности от
центра к хвостам.
18
19.
Оценка центраОценка центральной тенденции дает информацию о том, где находится центр
распределения. Для числовых данных чаще других используются две оценки центра:
среднее значение и медиана (еще одна оценка — мода — представляет значение, наиболее
часто встречающееся в выборке).
Среднее — это обычное среднее арифметическое: сумма значений переменной, деленная на
количество наблюдений (рассчитанных для интервальных данных), как в формуле:
σ
mathematics