2.87M
Category: informaticsinformatics

Визуализация теории информации

1.

24ИТ-1 Мацур Арина
Теория информации
Визуализация
теории информации

2.

Визуализация вероятностных
распределений
Визуализация данных — это область, которая
разрабатывает способы наглядного
представления абстрактной информации, чтобы
упростить её понимание. Абстрактные данные
могут быть как числовыми, так и текстовыми или
географическими.
Пример:
Осенью пасмурно. Допустим: в 60% - дождь, в 40%
случаев – солнце.
Объединение двух фактов в одной визуализации
не представляет сложности при условии, что они
независимы и не влияют друг на друга.
Например, добавим к первому еще то, что я в 25%
ношу туфли, а в 75% — кроссовки.

3.

Условные вероятности.
• Вероятность надеть туфли при условии солнца.
• Вероятность надеть кроссовки при условии дождя
C вероятностью 60% идет дождь. Если идет дождь с
вероятностью 75% я надену кроссовки. Таким образом
вероятность равна 60% от 75%, что составляет 45%.
Запишем это так:
p(дождь,кроссовки)=p(дождь)p(кроссовки|дождь)
Это пример одного из самых фундаментальных
тождеств теории вероятности.
p(x,y)= p(x)p(y|x)

4.

Визуализация теории информации
Представим двух друзей: один «говорит» двоичным кодом, другой использует всего
четыре слова — dog, cat, fish, bird. Чтобы они могли обмениваться сообщениями, нужна система
кодирования, которая сопоставляет каждому слову определённую последовательность битов.
Сообщение формируется путём замены слов их кодами и объединения этих кодов в одну
строку.
Если передача данных стоит дорого, возникает задача
сократить среднюю длину сообщения. Для анализа удобно
построить график: по вертикали — вероятность появления
слова p(кодового представления L(x). Площадь под диаграммой
показывает среднюю длину кодового слова.

5.

Cтремление сделать одни кодовые слова короче автоматически удлиняет другие,
поскольку код должен оставаться однозначно декодируемым. Чтобы
минимизировать среднюю длину сообщения, мы должны присвоить самые короткие
коды наиболее частым словам, пожертвовав длиной редких слов. Только такой
баланс позволяет снизить ожидаемую (среднюю) длину кодового слова.

6.

Оптимальное кодирование
Каждое кодовое слово занимает часть пространства возможных двоичных последовательностей. Чем
короче слово, тем бóльшую долю пространства оно "блокирует":
• Кодовое слово длиной 1 бит, например «0», стоит 1/2 — половина всех возможных последовательностей
начинается с этого бита.
• Кодовое слово длиной 2 бита, например «01», стоит 1/4 — четверть пространства начинается с этой комбинации.
Короткие кодовые слова выгодны тем, что уменьшают среднюю длину сообщения. Если мы используем
слово длиной L бит с вероятностью p, его вклад в среднюю длину составляет p × L. Это можно представить как
прямоугольник шириной L и высотой P.
Естественное решение — распределять пространство кодов
пропорционально частоте событий:
• Событие, происходящее в 50% случаев, получает 50% пространства
— право на короткое слово.
• Событие с вероятностью 1% получает только 1% пространства — ему
достается длинное слово.
Такой подход —позволяет достичь
оптимального баланса между стоимостью
кодовых слов и средней длиной сообщения

7.

Вычисление энтропии
1
Стоимость сообщения длиной L равна
мы можем инвертировать это значение,
2
English     Русский Rules