Материал: Лекции по информатике учебнометодическое пособие

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Количество информации как мера уменьшения неопределенности знаний

Подход к информации как к мере уменьшения неопределѐнно-сти наших знаний позволяет количественно измерять информацию,полученнуючерезнекотороесообщение.Например, после сдачи зачета Вы получаете одно из двух ин-формационных сообщений: "зачет" или "незачет", а после сдачи эк-заменаодноизчетырехинформационныхсообщений:"2","3","4"или"5".Информационное сообщение об оценке за зачет приводит куменьшению неопределенностивашегознания в два раза, так какреализуется один из двух возможных вариантов. Информационноесообщение об оценке за экзамен приводит к уменьшению неопреде-ленности вашего знания в четыре раза, так как получено одно из че-тырехвозможныхинформационныхсообщений.Ясно, что чем более неопределенна первоначальная ситуация,тем больше мы получим новой информации при получении инфор-мационного сообщения о том, как она разрешилась (тем в большееколичество разуменьшитсянеопределенностьзнания).Клод Шеннон предложил в 1948 году формулу для определе-ния количества информации, которую мы получаем после полученияодногоизNвозможныхсообщений:I=–(p1log2p1+p2log2p2+…pilog2pi+…+pNlog2pN)Здесь pi – вероятность того, что будет получено именно i-е со-общение. Если все сообщения равновероятны, то все pi=1/N, и изэтойформулы получаетсяформулаХартли:I =log2NДля количественного выражения любой величины необходимосначалаопределитьединицуизмерения.Так,дляизмерениядлиныв качестве единицы выбран метр, для измерения массы - килограмм и
т. д. Аналогично, для определения количества информации необхо-димоввести единицуизмерения.Из формулы Хартли следует: если I=1, то N=2, то есть в каче-стве единицы измерения информации можно взять тот объѐм инфор-мации, который мы получаем при принятии сигнала о том, что жепроизошло в ситуации с двумя возможными исходами. Такая едини-цаназванабитом.Наряду с единицей бит иногда используют в качестве единицинформации количества, взятые по логарифмам с другими основа-ниями: дит – по десятичному логарифму (за единицу информациивыбираетсяколичествоинформации,необходимойдляразличениядесяти равновероятных сообщений), нат – по натуральному основа-нию.ИспользуяформулуХартлиможно,также,знаяколичествоинформации, пришедшее с одним из равновероятных сообщений, оп-ределить, сколько сообщений вообще можно было ожидать в даннойситуации. Решив это уравнение относительно N, получим при равно-вероятныхисходах:I =log2N =2IНапример,наэкзаменевыберетеэкзаменационныйбилет,и учительсообщает,чтозрительное информационное сообщение оего номере несет 5 бит информации. Если вы хотите определить ко-личество экзаменационных билетов, то достаточно определить коли-чество возможных информационных сообщений об их номерахизформулыХартли:5 =log2N =25 =32.Такимобразом,количествоэкзаменационныхбилетовравно32.Задача:Представьтесебе,чтовыуправляетедвижениемро-бота и можете задавать направление его движения с помощью ин-формационных сообщений: "север", "северо-восток", "восток", "юго-восток", "юг", "юго-запад", "запад" и "северо-запад" (рис. 1.1). Какое

количество информации будет получать робот после каждого сооб- щения?




Рис. 1.1. Управление роботом с использова- нием информационных сообщений
В этой задаче робот может получить 8 разных информацион-ных сообщений. Формула Хартли принимает вид уравнения относи-тельно I:8=2IТаккак8=23,получаем23 =2I I =3Количество информации, которое несет роботу каждое инфор-мационноесообщение,равно 3битам.
    1. 1   2   3   4   5   6   7   8   9   ...   45

Алфавитный подход к определению количества информации

При алфавитном подходе к определению количества информа-ции отвлекаются от содержания информации и рассматривают ин-формационное сообщение как последовательность знаков определен-нойзнаковойсистемы.Представим себе, что необходимо передать информационноесообщение по каналу передачи информации от отправителя к получа-телю. Пусть сообщение кодируется с помощью знаковой системы,алфавит которой состоит из N знаков {1, ..., N} и вероятности появ-лениякаждогознакавсообщении равны.В простейшем случае, когда длина кода сообщения составляетодин знак, отправитель может послать N разных сообщений. Количе-ство информации I, которое несет каждое сообщение, то есть одинзнак,можно рассчитать поформулеХартли.I =log2NЭтавеличинаназываетсяинформационнойемкостьюзнака.С помощью этой формулы можно, например, определить информа-ционнуюемкость знакадвоичнойзнаковойсистемы:I=log22 =1битИнтересно, что сама единица измерения количества информа-ции "бит" (bit) получила свое название от английского словосочета-ния"binary digit"–"двоичнаяцифра".Чем большее количество знаков содержит алфавит знаковойсистемы, тем большее количество информации несет один знак. Вкачестве примера определим количество информации, которое несетбуква русского алфавита. В русский алфавит входят 33 буквы, однакона практике часто для передачи сообщений используются только 32буквы(исключаетсябуква"ѐ").С помощью формулы Хартли определим количество информа-ции,котороенесетбукварусскогоалфавита:

N = 32 I = log232 I = log225 I=5 бит.

Таким образом, информационная емкость буквы русского ал- фавита равна 5 битам (если считать, что все буквы используются в сообщении с равной вероятностью).

Количество информации, которое несет знак, зависит от веро- ятности его получения. Если получатель заранее точно знает, какой знак придет, то полученное количество информации будет равно 0. Наоборот, чем менее вероятно получение знака, тем больше его ин- формационная емкость.

Сообщение состоит из последовательности знаков, каждый из которых несет определенное количество информации. Если знаки не- сут одинаковое количество информации, то количество информации Ic в сообщении можно подсчитать, умножив количество информации Iз, которое несет один знак, на длину кода К (количество знаков в со- общении):

Ic = Iз * K

Например, каждая цифра двоичного компьютерного кода несет информацию в 1 бит. Следовательно, две цифры несут информацию в 2 бита, три цифры - в 3 бита и т. д. Количество информации в битах равно количеству цифр двоичного компьютерного кода (табл. 1.1).

Таблица 1.1.

Количество информации, которое несет двоичный компьютерный код


Двоичный компьютерный код

111

01

11

011

0001

Количество информации

3 бит

2 бит

2 бит

3 бит

4 бит
В русской письменной речи частота использования букв в тек-сте различна, так в среднем на 1000 знаков осмысленного текста при-ходится 200 букв "а" и в сто раз меньшее количество буквы "ф" (все-
Источник: https://files.student-it.ru/previewfile/157483