Курсовая работа: Анализ использования технологии Big Data в социальных сетях

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Министерство науки и высшего образования РФ

Ульяновский государственный университет

Факультет Математики, информационных и авиационных технологий

Кафедра Телекоммуникационные технологии и сети

Курсовая работа

по дисциплине «Теория информации»

«Анализ использования технологии Big Data в социальных сетях»

Барышев Д.А

Ульяновск

2022

Оглавление

  • Введение
  • 1. Теоретические основы исследования технологий Big Data
    • 1.1 Определение термина Big Data
    • 1.2 Разработка технологий Big Data и исследования в этой области
    • 1.3 Позиционирование технологии Big Data в прошлом и настоящем
    • 1.4 Социализация информационных технологий
  • 2. Технологии Big Data: контент обобществления коммуникаций
    • 2.1 Анализ использования технологий Big Data в социальных сетях
    • 2.2 Проблемы, возможности и перспективы использования технологии Big Data в социальных сетях
  • Заключение
  • Список использованных источников

Введение

Актуальность использования технологии Big Data достаточно велика, так как в данный момент она является одним из ключевых драйверов развития информационных технологий. Это направление, относительно новое для российского бизнеса, получило широкое распространение в западных странах. Связано это с тем, что в эпоху информационных технологий, особенно после бума социальных сетей, по каждому пользователю интернета стало накапливаться значительное количество информации, что в конечном счете дало развитие направлению Big Data.

Цель данной работы заключается в изучении теоретических исследований технологии Big Data, а также способов её использования в социальных сетях.

Основные задачи данной работы:

- Изучить что такие Big Data

- выявить состояние разработок, связанных с большими данными;

- изучить, как менялись взгляды на большие данные с течением времени

- продемонстрировать влияние информационных технологий на коммуникации в обществе;

- проанализировать способы использования больших данных в социальных сетях;

- выявить проблемы и перспективы применения технологий, связанных с большими данными, в социальных сетях.

Объектом исследования данной работы являются практика применения технологии Big Data в социальных сетях. Предмет исследования - совокупность социально-экономических отношений, выражающихся в виде научных статей, публикаций в СМИ, отчётов консалтинговых компаний, которые формируют представление о сущности и перспективах использования технологии Big Data, в том числе в социальных сетях.

Теоретическую базу исследования составляют позиционирование и представление технологии Big Data в научной среде.

Методологическую базу исследования составляют анализ и синтез, метод научных абстракций и моделирование, индукция и библиографический анализ.

Эмпирической основой курсовой работы являются аналитические обзоры, личные наблюдения и исследования.

Теоретическая значимость данной работы заключается объединении и систематизации накопленной информации по данной теме. Рассмотрение в данной конкретных примеров использования технологии Big Data представляет практическую значимость данной работы.

Полученные результаты могут быть использованы в дальнейшем в практической деятельности рекламных агентств.

Курсовая работа состоит из введения, двух глав, заключения и списка использованных источников.

1. Теоретические основы исследования технологий Big Data

1.1 Определение термина Big Data

Термин Big Data появился сравнительно недавно. Google Trends показывает начало активного роста употребления словосочетания начиная с 2011 года.

Так что же такое Big Data? За время поиска информации по этой теме я встречался с разными определениями:

- Big Data - это когда данных больше, чем 100Гб (500Гб, 1ТБ, кому что нравится)

- Big Data - это такие данные, которые сложно обрабатывать в Excel

- Big Data - это такие данные, которые невозможно обработать на одном компьютере

В этой работе я буду придерживаться определения с Wikipedia:

Большие данные (англ. big data) - серия подходов, инструментов и методов обработки структурированных и неструктурированных данных огромных объёмов и значительного многообразия для получения воспринимаемых человеком результатов, эффективных в условиях непрерывного прироста, распределения по многочисленным узлам вычислительной сети, сформировавшихся в конце 2000-х годов, альтернативных традиционным системам управления базами данных и решениям класса Business Intelligence.

Таким образом под Big Data я буду понимать не какой-то конкретный объём данных и даже не сами данные, а методы их обработки, которые позволяют распределенно обрабатывать информацию. Эти методы можно применить как к огромным массивам данных (таким как содержание всех страниц в интернете), так и к маленьким (таким как содержимое этой работы).

Приведу несколько примеров того, что может быть источником данных, для которых необходимы методы работы с большими данными:

- Логи поведения пользователей в интернете

- GPS-сигналы от автомобилей для транспортной компании

- Данные, снимаемые с датчиков в большом адронном коллайдере

- Оцифрованные книги в Российской Государственной Библиотеке

- Информация о транзакциях всех клиентов банка

- Информация о всех покупках в крупной ритейл сети и т.д.

1.2 Разработка технологий Big Data и исследования в этой области

Исследования, связанные с большими данными, являются актуальной областью разработок на сегодняшний день. Они изучают большие данные, а также способы выделения знаний из них. Они ведутся в рамках различных дисциплин и областей, таких как информационные науки, моделирование неопределённости, машинное обучение, статистическое обучение, распознавание образов, методы хранения данных, обработка сигналов и т.д. Исследования больших данных также имеют собственные проблемы и задачи. Проведём обзор ситуации в академической среде, охватывающей Big Data. Рассмотрим основные группы проблем исследований, связанных с большими данными.

Проблемы с хранением и анализом данных.

Проблема хранения возникает в силу увеличения скорости создания новых данных в последние годы. Благодаря мобильным устройствам, интернету вещей, увеличению доступности интернета и прочим факторам, объём производимой информации растёт в геометрической прогрессии. В силу недостатка места для их хранения они либо удаляются, либо не записываются вовсе. В связи с этим, возрастает роль носителей информации и скорости её записи и чтения для доступности больших данных с целью их анализа. Несмотря на достижения в этой области, такие как, например, распространение твердотельных накопителей, необходимая производительность накопителей для обработки больших данных до сих пор не достигнута.

Кроме объёмов производимой информации, в последние годы также нарастает и их разнообразие, что значительно усложняет задачи анализа больших данных. Возникает необходимость сжатии или выборке обрабатываемых данных, поскольку существующее методы и алгоритмы не позволяют за приемлемое время произвести их анализ. Автоматизация этого процесса, в том числе при помощи машинного обучения, и является задачей, стоящей перед исследователями.

Последние технологии, такие как Hadoop и MapReduce, позволяют собирать большие объёмы полуупорядоченных и неупорядоченных данных за приемлемое время. Для получения возможности их дальнейшей обработки они нуждаются в упорядочивании. Разработка алгоритмов упорядочивания данных также является актуальной задачей.

Проблема с выделением полезных знаний и вычислительная сложность обработки больших данных.

Выделение и представление знаний из больших данных - главная задача их обработки. Она включает в себя несколько подзадач, таких как аутентификация, архивирование, управление, сохранение, поиск и представление знаний. Алгоритмы, которые используются для решения этих задач, основаны, по большей части, на теории нечётких множеств и нечёткой логики, которые в настоящее время активно развиваются.

Анализ больших данных может представлять высокую вычислительную сложность. Главной проблемой при анализе является устранение несоответствий и неопределённости, которые присутствуют в наборах данных. Несмотря на то, что попытки преодоления вычислительной сложности реализуются в большинстве случаев обработки наборов больших данных, единого метода, применимого ко всем случаям, до сих пор не существует. Имеющиеся инструменты анализа имеют слишком низкую производительность и не в состоянии эффективно справляться с несоответствиями, неопределённостью и вычислительной сложностью, которые возникают при обработке наборов больших данных. Разработки в этой области уже имеются, а также проводятся новые, преимущественно с использованием машинного обучения. Главной целью ставится минимизация вычислительной сложности.

Проблемы визуализации больших данных.

В последнее время исследования в области больших данных позволили добиться ускорения их обработки, на фоне увеличения производительности процессоров по закону Мура. Несмотря на это, объёмы больших данных растут гораздо быстрее, чем производительность процессоров. В связи с этим, ставится задача распараллеливания вычислений между разными процессорами, в том числе между различными ядрами одного и того же процессора. Методы и алгоритмы параллельных вычислений являются одной из областей исследования.

Цель визуализации набора больших данных - дать аналитикам адекватное представление о его свойствах, помочь правильно их интерпретировать. Визуализация позволяет превратить большой массив данных в графики или изображения, которые дадут аналитикам интуитивное представление об их содержании. Современные инструменты визуализации обладают неудовлетворительной производительностью, функционалом и временем отклика, что также является проблемой исследований.

Проблемы информационной безопасности, связанной с большими данными.

В процессе анализа наборов больших данных из них добываются полезные знания. Разные организации имеют различную политику безопасности для защиты конфиденциальной информации, которая необходима в связи с высокими рисками, сопровождающими операции с большими данными. Информационная безопасность становится проблемой при анализе больших данных. Она может быть обеспечена при помощи техник аутентификации, авторизации и шифрования. Меры безопасности больших данных существуют в условиях компьютерных сетей, разнообразия девайсов, отслеживанием безопасности в реальном времени и проверкой на отсутствие утечек информации. Несмотря на наличие разработок в этой области, меры по обеспечению безопасности больших данных всё ещё нуждаются в улучшении. Главная задача состоит в том, чтобы разработать многоуровневую систему безопасности, обеспечивающую полноценную защиту приватности при обработке больших данных.

1.3 Позиционирование технологии Big Data в прошлом и настоящем

Понимание феномена больших данных менялось от момента его возникновения и до наших дней. Рассмотрим ключевые события, которые характеризуют смену и углубление взглядов на большие данные.

Сам термин Big Data был впервые введен в 1997 году Michael Cox и David Ellsworth на 8-й конференции IEEE по визуализации. Они назвали проблемой больших данных нехватку емкости основной памяти, локального и удаленного диска для выполнения виртуализации. А в 1998 году руководитель исследовательских работ в SGI John Mashey на конференции USENIX использовал термин Big Data в его современном виде.

Понимание возможностей больших данных появилось немного позже. Так, в ноябре 2000 года на восьмом всемирном конгрессе эконометрического сообщества Francis Diebold представил доклад под названием «Big Data Dynamic Factor Models for Macroeconomic Measurement and Fore-casting», в котором утверждал следующее: «В последнее время наука столкнулась с феноменом больших данных и извлекла из них выгоду. Большие данные - это рост количества (а иногда и качества) доступных и потенциально важных данных, который является следствием высоких достижений в области записи и хранения информации».

6 февраля 2001 года Douglas Laney из Meta Group (входит в состав Gartner) издал документ, описывающий основные проблемные зоны, связанные с повышенными требованиями к центральным хранилищам данных на фоне бурного роста e-commerce, а также делающий прогноз на изменение стратегии IT-компаний в отношении подходов к построению архитектуры решений, связанных с хранением и обработкой информации.

Было выделено три важнейших направления, на которых стоит сосредоточиться для решения вопросов управления данными: Volume (объёмы данных), Velocity (скорость накопления и обработки данных) и Variety (разнообразие источников и типов данных). Позже эти понятия стали основой для описательной модели больших данных под названием 3V (VVV).

Нужно учесть, что эти аспекты обсуждались без отсылки к понятию больших данных, но эти параметры описали основные принципы того, что сегодня называется Big Data.

Внимание широкой общественности к большим данным было привлечено в июне 2008 года, когда в журнале «Wired» вышла статья Chris Anderson «The end of theory: the data deluge makes the scientific method obsolete». В ней утверждалось, что всё возрастающий объём данных позволяет науке строить прогнозы, не формируя для этого теории. Знание о корреляции между величинами может быть достаточным для принятия решения.

Широкое введение термина «большие данные» в научной среде связывают с Clifford Lynch, редактором журнала Nature, подготовившим к 3 сентября 2008 года специальный выпуск с темой «Как могут повлиять на будущее науки технологии, открывающие возможности работы с большими объёмами данных?», в котором были собраны материалы о феномене взрывного роста объёмов и многообразия обрабатываемых данных и технологических перспективах в парадигме вероятного скачка от количества к качеству.

Источник: https://otherreferats.allbest.ru/download/1363361/