Дипломная работа: Изменение доверия к журналистскому контенту в связи с распространением технологии дипфейк

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

2.2 Способы обнаружения дипфейков

Журналисты понимают, что появление дипфейков - это тот вызов, который им придется принять первыми, поэтому уже сейчас стараются подготовиться к тому, чем угрожает новая технология. Новостное агентство Reuters запустило бесплатный онлайн-курс для журналистов о том, как бороться с фейковой информацией Identifying and tackling manipulated media // Reuters URL: https://www.reuters.com/manipulatedmedia?utm_campaign=ProMedia%20Report&utm_medium=email&utm_source=Revue%20newsletter&fbclid=IwAR2uk8TKSlBF4lSrM0KCgGT5ErbGACj8JEKOXjBi39EHTEq_UOo5msaH2lc (дата обращения: 20.04.2020).. Среди материалов - иллюстративные примеры разных видов фейков и тесты для самопроверки после каждой части курса. Отдельная часть курса посвящена дипфейкам: рассказывается, как работает дипфейк, даются способы его обнаружения. Принцип работы алгоритма GAN представлен в виде комикса с пояснениями. Такой легкий способ подачи информации особенно важен, так как курс рассчитан на представителей отрасли, никак не связанной с машинным обучением. В курсе рассмотрены такие возможности дипфейков как замена лиц, добавление или удаление объектов в кадре, создание полностью искусственных изображений или аудиозаписей. Reuters призывает коллег критически изучать поступающий контент и перед публикацией отвечать на несколько вопросов. Первая группа вопросов - можем ли мы перепроверить полученную видеозапись, изображение или аудиодорожку? Имеем ли мы возможность получить метаданные файла или проверить картинки по соответствию в поисковике? Не кажется ли качество файла подозрительно низким? Нет ли дефектов в аудиозаписи, которые говорили бы о ее искусственном происхождении (неправильно расставленные акценты в речи, монотонность интонации говорящего)? И, наконец, опубликована ли в других СМИ похожая новость с кадрами, которые отличаются от полученных (возможно, снятые другим человеком)? Вторая группа вопросов - как была получена информация? Что мы знаем о людях, которые поделились с нами сведениями, можно ли с ними связаться, отвечают ли они на наши вопросы? Какая выгода может быть в случае публикации такой информации?

Reuters выделяет еще несколько способов обнаружения дипфейков, подчеркивая, что они быстро устаревают, так как сгенерированный контент становится все более реалистичным. Так, в курсе останавливаются на таких особенностях дипфейков как неестественная мимика, отсутствие "живости" глаз, странная интонация или акцент говорящего, рассинхронизация аудио и видео.

В качестве заключения Reuters пишет, что в обнаружении дипфейков также важно то, сколько таких видеозаписей вы посмотрели. "Смотрите все последние созданные дипфейки. Чем больше вы смотрите и знакомитесь с этим типом контента, тем больше у вас шансов обнаружить его" Identifying and tackling manipulated media // Reuters URL: https://www.reuters.com/manipulatedmedia/en/chapter-3-tackling-manipulated-media (дата обращения: 20.04.2020).. Исследования агентства Reuters показывают, что журналисты, следующие этим советам, с большей вероятностью способны обнаружить дипфейк среди реальных видео.

Распространение дипфейков всерьез беспокоит не только отдельных исследователей в области медиа, но и целые государства, где создаются специальные центры по борьбе с недостоверным контентом. Один из таких примеров - команда MediFor (сокращение от Media Forensics), созданная в США при на базе агентства DARPA. MediFor была создана, чтобы "выровнять ситуацию на игровом поле цифровых изображений, которая в настоящее время благоприятна для манипуляций, путем разработки технологий автоматизированной оценки изображений или видео" Министерство обороны США попытается решить проблему deepfake // Хабр URL: https://habr.com/ru/news/t/463395/ (дата обращения: 12.04.2020).. Проект запустили в 2016 году, и он боролся с видео, полученными в процессе недобросовестного монтажа, но оказался действенен в борьбе с дипфейками. Изначально создавалась система, которая обнаруживает фейковые видео на трех уровнях. На первом уровне алгоритм пытается найти на изображении или видео артефакты сжатия и цифровой шум, которые должны быть идентичны для всех фрагментов изображения, присутствовать на всех кадрах видео. Такие артефакты могут быть невидимы для человеческого глаза, но оставлять цифровые подсказки, которые будут считаны при анализе. Затем рассматриваются форматы освещенности: освещение на лице должно быть таким же, как и на других объектах, все предметы должны иметь тени. И на последнем, семантическом уровне, для определения поддельных фото или видео используются данные, которые могут быть подтверждены или опровергнуты данными из реального мира: "Если, допустим, утверждается, что видео, на котором запечатлели игру в футбол, было снято в Центральном парке в 14 часов во вторник, 9 октября 2018 года, совпадает ли состояние неба с погодным архивом?" Эти новые уловки пока ещё способны перехитрить видеоролики от Deepfake // Хабр URL: https://habr.com/ru/post/429192/ (дата обращения: 12.04.2020).. К семантической целостности относится также наличие других копий изображения или видео, которые можно найти в архивах или интернете. Считывая историю манипуляций над цифровым объектом, можно понять, отличается ли он от первоисточника и какие манипуляции были произведены.

Для обнаружения дипфейков исследователи сосредоточились на нескольких главных деталях, по которым можно отличить дипфейк от реального видео. Первое - это движение губ, которое может быть не синхронизовано с речью, второе - общее несоответствие "сцены и говорящего" DARPA is funding new tech that can identify manipulated videos and `deepfakes' // techcrunch URL: https://techcrunch.com/2018/04/30/deepfakes-fake-videos-darpa-sri-international-media-forensics/ (дата обращения: 12.04.2020)., третье - идентификация склеек и видеомонтажа. В ходе работы исследователи дорабатывали алгоритм, находя и другие интересные детали. Например, Сывей Люй рассказывает, что одна из вещей, которые смущали его в сгенерированных видео - это то, что люди на них практически не моргают. В статье Люя "In Ictu Oculi: Exposing AI Generated Fake Face Videos by Detecting Eye Blinking" Эти новые уловки пока ещё способны перехитрить видеоролики от Deepfake // Хабр URL: https://habr.com/ru/post/429192/ (дата обращения: 12.04.2020). написано, что интервал между морганием для здорового человека в среднем составляет 210 секунд, но может варьироваться в ту или иную сторону. Это знание помогло определить множество дипфейков, но вскоре после этого на почту Люя пришло письмо, в котором содержались ссылки на фейковые видео, где люди моргали с нормальной частотой. Люй не видит в этом проблемы: его команда пытается усложнить жизнь создателям дипфейков, а не распознавать все видео - это было бы невозможно. "Мы пытаемся поднять планку, - говорит он. - Мы хотим усложнить этот процесс, сделать его более затратным по времени" Там же.

В статье Люя описаны и другие сигналы, которые помогают отличить сгенерированные видео от реальных. Например, это дыхание и пульс. Считается, что пока дипфейки не способны достоверно воспроизвести такие нюансы, особенно если они были обучены на изображениях, а не на видео.

Однако качество дипфейков - это вопрос времени. Мэт Турек, один из сотрудников DARPA считает, что вскоре мы столкнемся с фабрикацией не только видео, но целых событий: "Не просто одно изображение или отредактированное видео, но несколько изображений или роликов, пытающихся передать убедительное сообщение" Там же. Особенно это опасно для СМИ, которые могут, сами не зная об этом, транслировать целиком фейковый контент, убежденные в его правдивости и неспособные распознать подделку.

Проблемой распознавания дипфейков интересуются, в том числе, большие корпорации. Facebook совместно с Microsoft провели конкурс по распознаванию дипфейков. Основная проблема, связанная с такими соревнованиями - отсутствие датасетов, на которых могли бы обучаться участники конкурса. Те дипфейки, которые есть в интернете, созданы без согласия их главных героев, а значит, не подходят для серьезной исследовательской работы. Две корпорации при поддержке ученых из ведущих университетов (Оксфордского университета, Массачусетского технологического института и других) создали собственный датасет видео, из которых больше половины - дипфейки, а остальное - реальные видео. В создании видео и дипфейков принимали участие актеры, которые дали свое согласие на использование их лиц. Чтобы стимулировать участников конкурса, организаторы решили выделить лучшим из них денежные призы: занявшему первое место заплатят 500 тысяч долларов. Всего на призовой фонд, подготовку и исследование данных было потрачено более 10 миллионов долларов, что говорит о важности конкурса и тех результатов, которые он принесет. Важность конкурса подчеркивают и внешние эксперты. Профессор Оксфордского университета Филип Х.С. Торр считает, что проблема обнаружения дипфейков особенно важна: "Манипулирование СМИ и гражданами, распространение в интернете фиктивных теорий заговора ради политической выгоды - проблемы глобального масштаба, поскольку это фундаментальная угроза демократии, а следовательно, и свободы. Я считаю, что нам срочно нужны новые инструменты для обнаружения недостоверной информации, поэтому я рад быть частью инициативы, которая направлена на мобилизацию исследовательского сообщества вокруг этих целей - как для сохранения истины, так и для расширения границ научной деятельности" Creating a data set and a challenge for deepfakes // Facebook AI URL: https://ai.facebook.com/blog/deepfake-detection-challenge (дата обращения: 10.04.2020)..

Этот конкурс прошел на открытой площадке соревнований по машинному обучению Kaggle Deepfake Detection Challenge // Kaggle URL: https://www.kaggle.com/c/deepfake-detection-challenge (дата обращения: 10.04.2020). и завершился 1 апреля. На странице соревнования написано, что его цель - подтолкнуть исследователей в области Data Science к созданию новых технологий, которые будут обнаруживать дипфейки и препятствовать их распространению в медиа.

Конкурсанты подходили к задаче по-разному, но в целом алгоритм был схожим: раскадровка имеющихся видео, выделение лиц в получившихся кадрах и обучение нейросети на основе последовательности бит. Рассмотрим несколько конкурсных решений.

Участник соревнования с ником Gabriel Preda представил последовательную и очень подробную схему предобработки данных DeepFake Starter Kit // Kaggle URL: https://www.kaggle.com/gpreda/deepfake-starter-kit (дата обращения: 10.04.2020). соревнования. Для начала он предлагает исследовать данные, которые составляют обучающую и тестовую выборку. Формат представленных данных - mp4, также есть json файл, в котором хранятся размеченные данные для обучения (указание на то, какие видео являются дипфейками, а какие - нет, а также указание на первоисточник для дипфейков). Первые несколько строк выглядят так:

label

split

original

aagfhgtpmv.mp4

FAKE

train

vudstovrck.mp4

aapnvogymq.mp4

FAKE

train

jdubbvfswz.mp4

abarnvbtwb.mp4

REAL

train

None

В датасете нет пропущенных данных, все они уже размечены и готовы к работе. На этом же шаге мы выяснили, что на обучающей выборке более 80% дипфейк-видео.

Перед тем, как приступить непосредственно к написанию кода, Gabriel Preda исследует видеофайлы. Этот шаг необходим для того, чтобы выявить закономерности, присущие дипфейкам. Изучение исходных данных может помочь определиться с дальнейшими действиями, например, какой алгоритм применять для обнаружения дипфейков. Gabriel Preda исследует одни и те же кадры поддельных и реальных видео, что позволяет лучше понять, как именно производилась замена лиц.

Следующий шаг - это обнаружение лица на каждом кадре видео. Для этого участник конкурса использует открытый код участника другого соревнования Face Detection with OpenCV // Kaggle URL: https://www.kaggle.com/serkanpeldek/face-detection-with-opencv (дата обращения: 10.04.2020).. Этот код использует каскадный классификатор, который позволяет обнаружить лицо в анфас, профиль, отдельно выделять глаза и губы. Теперь функции по обнаружению лица необходимо передавать кадры видео, на которых должно быть распознано лицо.

Для обнаружения лиц существует множество алгоритмов. Интересно решение Энрике Мендоса, который использовал сеть FaceNet. Это сиамская сеть, которая применяется для поиска похожих лиц, преобразуя изображения в евклидово пространство, где дистанция соответствует мере схожести. Чем меньше дистанция, тем более похожи два лица. Энрике запустил предобученную FaceNet на всех кадрах реальных видео. Он получил 8 кластеров - ровно столько, сколько реальных видео было взято, то есть нейросеть выделила и распознала все лица верно.

Участник конкурса с ником Navi для распознавания лица использовал сеть на базе CNN - MTCNN, которая обладает хорошей точностью. С помощью этой сети также можно выделять характерные точки лица (глаза, уголки рта, нос). Решение Navi - одно из лучших публичных решений участников конкурса (на момент до окончания конкурса, когда победители соревнования не выложили свои решения), поэтому было бы интересно рассмотреть его целиком. Первые шаги стандартны: импорт необходимых библиотек, прописывание путей для открытия видеозаписей. Затем Navi разбивает видео на кадры, включает распознавание лиц и инициализирует модель. Для обучения автор решения использует предобученную сеть EfficientNet, которая оптимизирует сверточные сети, при этом дает хороший прирост в качестве. Обучая EfficientNet, автор добавил важный шаг - аугментацию данных. Аугментация - это модификация существующих данных (отражение изображения, поворот изображения, операции с цветом) для расширения обучающей выборки. В задаче с обнаружением дипфейков при маленькой обучающей выборке аугментация выступает как способ регуляризации и позволяет избежать переобучения.

Малое количество участников задумалось о том, что среди дипфейков может попасться не только замена лица, но и замена аудиодорожки. Одно из решений по обнаружению аудио принадлежит пользователю с ником btk1. Он использует пакет ffmpeg, который эффективно работает с аудио. Но, как показал опыт других участников соревнования, фейковые аудиозаписи распознаются гораздо хуже и даже с хорошо обученным алгоритмом не дают прироста качества.

Участники соревнования в целом шли по схожему сценарию, экспериментируя с разными нейросетями при обучении. По-разному решались вопросы дисбаланса классов: одни участники игнорировали этот момент, другие делали количество дипфейков и реальных видео одинаковым. Участники использовали разные сети для обнаружения лиц (а кто-то обошелся и без этого), но на всех представленных примерах точность распознавания была примерно одинаковой. Действительно важным стал выбор модели при обучении: какие-то из них давали хороший прирост качества, другие не подходили для поставленных задач.

Источник: https://otherreferats.allbest.ru/download/1215674/