Министерство науки и высшего образования РФ
Ульяновский государственный университет
Факультет Математики, информационных и авиационных технологий
Кафедра Телекоммуникационные технологии и сети
Курсовая работа
по дисциплине «Теория информации»
«Анализ использования технологии Big Data в социальных сетях»
Барышев Д.А
Ульяновск
2022
Оглавление
Введение
Актуальность использования технологии Big Data достаточно велика, так как в данный момент она является одним из ключевых драйверов развития информационных технологий. Это направление, относительно новое для российского бизнеса, получило широкое распространение в западных странах. Связано это с тем, что в эпоху информационных технологий, особенно после бума социальных сетей, по каждому пользователю интернета стало накапливаться значительное количество информации, что в конечном счете дало развитие направлению Big Data.
Цель данной работы заключается в изучении теоретических исследований технологии Big Data, а также способов её использования в социальных сетях.
Основные задачи данной работы:
- Изучить что такие Big Data
- выявить состояние разработок, связанных с большими данными;
- изучить, как менялись взгляды на большие данные с течением времени
- продемонстрировать влияние информационных технологий на коммуникации в обществе;
- проанализировать способы использования больших данных в социальных сетях;
- выявить проблемы и перспективы применения технологий, связанных с большими данными, в социальных сетях.
Объектом исследования данной работы являются практика применения технологии Big Data в социальных сетях. Предмет исследования - совокупность социально-экономических отношений, выражающихся в виде научных статей, публикаций в СМИ, отчётов консалтинговых компаний, которые формируют представление о сущности и перспективах использования технологии Big Data, в том числе в социальных сетях.
Теоретическую базу исследования составляют позиционирование и представление технологии Big Data в научной среде.
Методологическую базу исследования составляют анализ и синтез, метод научных абстракций и моделирование, индукция и библиографический анализ.
Эмпирической основой курсовой работы являются аналитические обзоры, личные наблюдения и исследования.
Теоретическая значимость данной работы заключается объединении и систематизации накопленной информации по данной теме. Рассмотрение в данной конкретных примеров использования технологии Big Data представляет практическую значимость данной работы.
Полученные результаты могут быть использованы в дальнейшем в практической деятельности рекламных агентств.
Курсовая работа состоит из введения, двух глав, заключения и списка использованных источников.
1. Теоретические основы исследования технологий Big Data
1.1 Определение термина Big Data
Термин Big Data появился сравнительно недавно. Google Trends показывает начало активного роста употребления словосочетания начиная с 2011 года.
Так что же такое Big Data? За время поиска информации по этой теме я встречался с разными определениями:
- Big Data - это когда данных больше, чем 100Гб (500Гб, 1ТБ, кому что нравится)
- Big Data - это такие данные, которые сложно обрабатывать в Excel
- Big Data - это такие данные, которые невозможно обработать на одном компьютере
В этой работе я буду придерживаться определения с Wikipedia:
Большие данные (англ. big data) - серия подходов, инструментов и методов обработки структурированных и неструктурированных данных огромных объёмов и значительного многообразия для получения воспринимаемых человеком результатов, эффективных в условиях непрерывного прироста, распределения по многочисленным узлам вычислительной сети, сформировавшихся в конце 2000-х годов, альтернативных традиционным системам управления базами данных и решениям класса Business Intelligence.
Таким образом под Big Data я буду понимать не какой-то конкретный объём данных и даже не сами данные, а методы их обработки, которые позволяют распределенно обрабатывать информацию. Эти методы можно применить как к огромным массивам данных (таким как содержание всех страниц в интернете), так и к маленьким (таким как содержимое этой работы).
Приведу несколько примеров того, что может быть источником данных, для которых необходимы методы работы с большими данными:
- Логи поведения пользователей в интернете
- GPS-сигналы от автомобилей для транспортной компании
- Данные, снимаемые с датчиков в большом адронном коллайдере
- Оцифрованные книги в Российской Государственной Библиотеке
- Информация о транзакциях всех клиентов банка
- Информация о всех покупках в крупной ритейл сети и т.д.
1.2 Разработка технологий Big Data и исследования в этой области
Исследования, связанные с большими данными, являются актуальной областью разработок на сегодняшний день. Они изучают большие данные, а также способы выделения знаний из них. Они ведутся в рамках различных дисциплин и областей, таких как информационные науки, моделирование неопределённости, машинное обучение, статистическое обучение, распознавание образов, методы хранения данных, обработка сигналов и т.д. Исследования больших данных также имеют собственные проблемы и задачи. Проведём обзор ситуации в академической среде, охватывающей Big Data. Рассмотрим основные группы проблем исследований, связанных с большими данными.
Проблемы с хранением и анализом данных.
Проблема хранения возникает в силу увеличения скорости создания новых данных в последние годы. Благодаря мобильным устройствам, интернету вещей, увеличению доступности интернета и прочим факторам, объём производимой информации растёт в геометрической прогрессии. В силу недостатка места для их хранения они либо удаляются, либо не записываются вовсе. В связи с этим, возрастает роль носителей информации и скорости её записи и чтения для доступности больших данных с целью их анализа. Несмотря на достижения в этой области, такие как, например, распространение твердотельных накопителей, необходимая производительность накопителей для обработки больших данных до сих пор не достигнута.
Кроме объёмов производимой информации, в последние годы также нарастает и их разнообразие, что значительно усложняет задачи анализа больших данных. Возникает необходимость сжатии или выборке обрабатываемых данных, поскольку существующее методы и алгоритмы не позволяют за приемлемое время произвести их анализ. Автоматизация этого процесса, в том числе при помощи машинного обучения, и является задачей, стоящей перед исследователями.
Последние технологии, такие как Hadoop и MapReduce, позволяют собирать большие объёмы полуупорядоченных и неупорядоченных данных за приемлемое время. Для получения возможности их дальнейшей обработки они нуждаются в упорядочивании. Разработка алгоритмов упорядочивания данных также является актуальной задачей.
Проблема с выделением полезных знаний и вычислительная сложность обработки больших данных.
Выделение и представление знаний из больших данных - главная задача их обработки. Она включает в себя несколько подзадач, таких как аутентификация, архивирование, управление, сохранение, поиск и представление знаний. Алгоритмы, которые используются для решения этих задач, основаны, по большей части, на теории нечётких множеств и нечёткой логики, которые в настоящее время активно развиваются.
Анализ больших данных может представлять высокую вычислительную сложность. Главной проблемой при анализе является устранение несоответствий и неопределённости, которые присутствуют в наборах данных. Несмотря на то, что попытки преодоления вычислительной сложности реализуются в большинстве случаев обработки наборов больших данных, единого метода, применимого ко всем случаям, до сих пор не существует. Имеющиеся инструменты анализа имеют слишком низкую производительность и не в состоянии эффективно справляться с несоответствиями, неопределённостью и вычислительной сложностью, которые возникают при обработке наборов больших данных. Разработки в этой области уже имеются, а также проводятся новые, преимущественно с использованием машинного обучения. Главной целью ставится минимизация вычислительной сложности.
Проблемы визуализации больших данных.
В последнее время исследования в области больших данных позволили добиться ускорения их обработки, на фоне увеличения производительности процессоров по закону Мура. Несмотря на это, объёмы больших данных растут гораздо быстрее, чем производительность процессоров. В связи с этим, ставится задача распараллеливания вычислений между разными процессорами, в том числе между различными ядрами одного и того же процессора. Методы и алгоритмы параллельных вычислений являются одной из областей исследования.
Цель визуализации набора больших данных - дать аналитикам адекватное представление о его свойствах, помочь правильно их интерпретировать. Визуализация позволяет превратить большой массив данных в графики или изображения, которые дадут аналитикам интуитивное представление об их содержании. Современные инструменты визуализации обладают неудовлетворительной производительностью, функционалом и временем отклика, что также является проблемой исследований.
Проблемы информационной безопасности, связанной с большими данными.
В процессе анализа наборов больших данных из них добываются полезные знания. Разные организации имеют различную политику безопасности для защиты конфиденциальной информации, которая необходима в связи с высокими рисками, сопровождающими операции с большими данными. Информационная безопасность становится проблемой при анализе больших данных. Она может быть обеспечена при помощи техник аутентификации, авторизации и шифрования. Меры безопасности больших данных существуют в условиях компьютерных сетей, разнообразия девайсов, отслеживанием безопасности в реальном времени и проверкой на отсутствие утечек информации. Несмотря на наличие разработок в этой области, меры по обеспечению безопасности больших данных всё ещё нуждаются в улучшении. Главная задача состоит в том, чтобы разработать многоуровневую систему безопасности, обеспечивающую полноценную защиту приватности при обработке больших данных.
1.3 Позиционирование технологии Big Data в прошлом и настоящем
Понимание феномена больших данных менялось от момента его возникновения и до наших дней. Рассмотрим ключевые события, которые характеризуют смену и углубление взглядов на большие данные.
Сам термин Big Data был впервые введен в 1997 году Michael Cox и David Ellsworth на 8-й конференции IEEE по визуализации. Они назвали проблемой больших данных нехватку емкости основной памяти, локального и удаленного диска для выполнения виртуализации. А в 1998 году руководитель исследовательских работ в SGI John Mashey на конференции USENIX использовал термин Big Data в его современном виде.
Понимание возможностей больших данных появилось немного позже. Так, в ноябре 2000 года на восьмом всемирном конгрессе эконометрического сообщества Francis Diebold представил доклад под названием «Big Data Dynamic Factor Models for Macroeconomic Measurement and Fore-casting», в котором утверждал следующее: «В последнее время наука столкнулась с феноменом больших данных и извлекла из них выгоду. Большие данные - это рост количества (а иногда и качества) доступных и потенциально важных данных, который является следствием высоких достижений в области записи и хранения информации».
6 февраля 2001 года Douglas Laney из Meta Group (входит в состав Gartner) издал документ, описывающий основные проблемные зоны, связанные с повышенными требованиями к центральным хранилищам данных на фоне бурного роста e-commerce, а также делающий прогноз на изменение стратегии IT-компаний в отношении подходов к построению архитектуры решений, связанных с хранением и обработкой информации.
Было выделено три важнейших направления, на которых стоит сосредоточиться для решения вопросов управления данными: Volume (объёмы данных), Velocity (скорость накопления и обработки данных) и Variety (разнообразие источников и типов данных). Позже эти понятия стали основой для описательной модели больших данных под названием 3V (VVV).
Нужно учесть, что эти аспекты обсуждались без отсылки к понятию больших данных, но эти параметры описали основные принципы того, что сегодня называется Big Data.
Внимание широкой общественности к большим данным было привлечено в июне 2008 года, когда в журнале «Wired» вышла статья Chris Anderson «The end of theory: the data deluge makes the scientific method obsolete». В ней утверждалось, что всё возрастающий объём данных позволяет науке строить прогнозы, не формируя для этого теории. Знание о корреляции между величинами может быть достаточным для принятия решения.
Широкое введение термина «большие данные» в научной среде связывают с Clifford Lynch, редактором журнала Nature, подготовившим к 3 сентября 2008 года специальный выпуск с темой «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?», в котором были собраны материалы о феномене взрывного роста объёмов и многообразия обрабатываемых данных и технологических перспективах в парадигме вероятного скачка от количества к качеству.