Анализ чс LTR HERV-K (HML-2), картированных в интронах генов. С помощью сервера UCSC Browser (http://genome.ucsc.edu/cgi-bin/hgGateway), мы обнаружили 30 представителей семейства в интронах известных человеческих генов. Было установлено, что LTR в интронах генов имеют неслучайную ориентацию: в 29 из 30 генов LTR направлен в сторону, противоположную направлению транскрипции гена.
Это может быть объяснено тем, что внедрение LTR, обладающих сильным сигналом терминации транскрипции, в интроны генов в прямой ориентации вызывало бы преждевременную терминацию транскрипции этих генов, и, как следствие, приводило бы к их инактивации. Поэтому аллели, несущие в интронах LTR в прямой ориентации, должны были неизбежно отбрасываться в ходе эволюции генома человека. Сохранение аллеля, содержащего LTR в прямой ориентации в интроне flj20276 (см. Рис. 1.4.2), возможно, связано с инактивацией терминатора этого LTR. В некоторых генах внедрения чс LTR произошли в непосредственной близости от экзонов, что могло привести к плавному изменению экспрессии этих генов по механизму тканеспецифической антисмысловой регуляции (тканеспецефичность работы промотора и энхансера LTR HERV-K показана в работах (266-268)).
Рисунок 1.4.2. Схема расположения 10 человек-специфичных LTR в интронах генов. Жирными стрелками обозначено направление транскрипции генов, стрелками среднего размера - расположение HERV-K или их одиночных LTR.
Найденные в результате работы 134 специфичных для генома человека LTR HERV-K представлены в сводной таблице, доступной в Интернет по адресу http://www.thescientificworld.com/supplements/2007.270/Buzdin_031307_SuppTable1.xls.
1.4.2 Идентификация человек-специфичных вставок ретроэлементов L1
Следующим объектом, для которого был применён метод TGDA, стало семейство ретротранспозонов L1, содержащее чс элементы, а также около 50 до сих пор активных представителей в геноме человека. Как и в случае HERV-K(HML-2), мы искали чс интеграции ретроэлементов. Работа проводилась в 2002-2003 годах, когда в базах данных не содержалось информации по геному шимпанзе, и единственным способом поиска чс элементов являлся экспериментальный анализ.
Поскольку подавляющее большинство L1 укорочено с 5' -конца, на первой стадии мы амплифицировали последовательности геномов человека (трейсер) и шимпанзе (драйвер), граничащие с 3'- концевыми районами L1(269).
Мы выбрали последовательность 3'-нетранслируемого участка (3'UTR) L1 как цель для подбора праймеров, направленных наружу от L1 (схема расположения праймеров представлена на Рис. 1.4.3), поскольку район 3'UTR L1 высоко вариабелен среди различных семейств L1 человека, будучи в то же время относительно консервативным для представителей молодых групп L1. Это делает возможным дискриминировать эволюционно молодые L1. Были подобраны праймеры на позиции 311-335 и 352-378 консенсусных последовательностей 3'UTR семейств L1Hs (оно же: L1PA1) и L1PA2 (270). Это позволило селективно амплифицировать 3'- фланкирующие участки L1 этих двух молодых семейств, некоторые представители которых в геноме человека известны как активные транспозоны.
Оценочное число членов этих двух семейств в ДНК человека составляет 17.600, или 3,4% всех человеческих L1 (270). Селективная амплификация фланкирующих их последовательностей позволяет получить смесь достаточно упрощённую для того, чтобы фрагменты реассоциировали за не слишком длительное для проведения эксперимента время. В этом исследовании при проведении ВГ использовались следующие условия: концентрация трейсера 1,9x10-12 M, концентрация драйвера 3,6x10-10 M, время реассоциации 14 часов. Согласно оценке, за это время должна пройти 99% реассоциация трейсера, а итогом должно стать 17-кратное обогащение ренатурировавших фрагментов трейсера фланками чс L1.
Продукты ВГ клонировали в E. coli, затем отсеквенировали последовательности вставок из 29 случайно отобранных клонов. Все вставки содержали ожидаемые фрагменты L1 семейств L1PA2 и L1Hs, что, как и в случае LTR HERV-K (HML-2), демонстрировало высокую селективность метода. Длины фланкирующих L1 последовательностей в составе клонов различались от 129 дo 621 нуклеотидов, со средней длиной 270 нуклеотидов. Поиск в GenBank позволил для 28 из этих фланков L1 обнаружить в базах данных гомологичные уникальные последовательности, в соответствующих локусах 9 из которых содержали полноразмерные L1 и 19 - 5'-укороченные.
Как и в случае LTR HERV-K(HML-2), с целью определения специфичности данных L1 для генома человека, проводился ПЦР-анализ (Рис. 1.4.3) со специфичными геномными праймерами (G1 и G2), фланкирующими интеграцию ретроэлемента, а также с праймером, специфичным для L1 (праймер T2).
Из 29 отобранных клонов видоспецифичность интеграции определили для 26 последовательностей, 24 из них были чс, а 2 клона содержались также в геноме шимпанзе. Это говорит о том, что чс последовательности содержатся приблизительно в 92% клонов библиотеки. Мы показали, что по крайней мере 3 последовательности L1 из 24 (13%) являются полиморфными в человеческой популяции. Три других клона из 29 не были охарактеризованы окончательно: не были получены продукты ПЦР с праймерами G1+G2, хотя результаты геномных ПЦР с парами праймеров G1+T2 свидетельствовали в пользу специфичности этих L1 для генома человека.
Для того, чтобы найти значение обогащения вычтенной библиотеки по чс последовательностям, мы определили значения обогащения библиотеки по последовательностям 4 фланков чс L1, найденных в этой работе (для этого использовались локусы 3q14 (AF496639), 15q21 (AF496640), 1p21 (AF496647) и 13q32 (AF496650)). Во всех случаях продукты ПЦР появлялись на 2 цикла раньше при использовании “вычтенной” матрицы, чем при использовании “невычтенной”, что свидетельствует о 4-кратном обогащении полученной библиотеки чс последовательностями.
Рисунок 1.4.3. (А) Схема анализируемого локуса Хq25 геномов человека и шимпанзе. На схеме представлены ожидаемые продукты ПЦР-амплификации, а также указано расположение указанных праймеров. Электрофореграмма продуктов ПЦР-амплификации с использованием праймеров Gfor/ Grev (Б), L1for/ Grev (В). Ч1, Ч2, матрица - ДНК человека; Ш1, Ш2, матрица - ДНК шимпанзе. По итогам ПЦР-анализа анализируемое внедрение L1 было признано специфичным для ДНК человека.
Это экспериментально полученное значение обогащения 4 существенно меньше рассчётного (17, см. выше), что, по-видимому, вызвано исходно высоким содержанием чс последовательностей в “невычтенном” трейсере. Действительно, ~92% клонов обогащённой библиотеки являются чс L1. Это обозначает, что примерно четверть исходной “невычтенной” библиотеки составляют чс L1.
Эти факты ((1) фракция ДНК, использованная для ВГ, содержала 3'-фланки приблизительно 17.600 L1, (2) обогащение вычтенной библиотеки чс последовательностями составило 4, (3) чс фланки L1 занимают примерно 92% клонов вычтенной библиотеки) позволили оценить суммарное количество чс интеграций L1 в ДНК человека как ~4000 (17600 x 1/4 x 0,92). Позднее, при прямом сравнении опубликованных последовательностей геномов человека и шимпанзе, эта оценка была скорректирована до ~1200 элементов (271).
Большинство найденных чс L1 (70%) являются 5'-укороченными транспозонами, что хорошо согласуется с данными, опубликованными Буассино и др. (272, 273) для представителей эволюционно молодой группы LINE человека L1-Ta (от англ. transcriptionnaly active), 34% которой составляют полноразмерные L1s против 66% укороченных. Такие значения гораздо выше, чем среднее содержание полноразмерных L1 в геноме человека (менее 1%) среди всего множества L1(269). Это свидетельствует в пользу того, что в ходе эволюции генома L1 подвергались направленным делециям, сходным с направленным удалением L1 из GC-богатых локусов генома, описанным в работе Овчинникова и др. (274). 17% L1 содержат инверсии и 26% (7 ретроэлементов) содержат трансдуцированные 3'-фланкирующие последовательности, вероятно захваченные при ретропозиции L1 (275, 276).
Все найденные в данной работе чс L1 принадлежали к группам L1PA2 и L1Hs. Лишь небольшая часть (26%) этих чс L1 принадлежала к группе Ta, которая известна как единственная транспозиционно активная в настоящее время группа L1. В этой работе нами было найдено внедрение L1, принадлежащего к группе L1PA2, которое является полиморфным в человеческой популяции. Следовательно, (i) по крайней мере два семейства L1 были активны в предковой линии человека после расхождения её с предковой линией шимпанзе и (ii) при поиске полиморфных интеграций L1 не следует ограничивать поиск группой L1 Ta.
Один чс L1 являлся представителем открытого в данной работе химерного семейства ретроэлементов U6-L1, детально описанного в следующем разделе.
1.4.3 Новое семейство химерных ретроэлементов эукариот
Пожалуй, наиболее неожиданным результатом анализа библиотеки чс внедрений L1 стало открытие нового семейства ретроэлементов, образованных при происходящей in vivo РНК-рекомбинации в ходе обратной транскрипции. Упомянутый механизм образования ретроэлементов впервые предложен коллективом авторов данной работы.
В ходе анализа полученной с помощью TGDA библиотеки чс L1-фланкирующих последовательностей, мы нашли один клон, соответствовавший внедрению ретроэлемента весьма необычной структуры, см. Рис. 1.4.4. Последовательность вставки была гомологична геномной ДНК человека хромосомного локуса 10p13 (код доступа в GenBank AL138764). Ретроэлемент представлял собой химеру полной копии U6 мя РНК с 3'-концевой частью L1. Последовательность ретротранскрипта была названа нами U6-L1 10p13. Её 5'-часть является полноразмерной последовательностью U6 мяРНК длиной 107 пн, 100% идентичная консенсусной последовательности человеческой U6 (взята из базы данных RepBase Update, http://www.girinst.org/server/RepBase/). Сразу за U6 следует 3'- концевая последовательность элемента L1 семейства L1Hs в прямой ориентации длиной 1324 пн. На своём 3'- конце эта последовательность несёт поли-А “хвост” длиной 40 пн. Химерный ретротранскрипт фланкирован прямыми повторами AAAAATGTTAAACCATGGGT длиной 20 пн.
Гексануклеотид TTAAAA, расположенный на 22 пн выше сайта интеграции U6-L1, идентичен последовательности T2A4, которую предпочтительно узнаёт эндонуклеаза L1 (L1-EN), инициирующая интеграцию L1 копий в соответствующие сайты генома (277, 278).
Рисунок 1.4.4. Схема строения химерного ретроэлемента U6-L1 из геномного локуса 10р13.
Предпринятый с помощью программы BLAT (http://genome.ucsc.edu/cgi-bin/hgBLAT) поиск в геномных базах данных человека выявил 161 полноразмерную последовательность U6 мяРНК, от 85 дo 100% идентичную человеческой консенсусной последовательности U6.
105 из этих 161 последовательности представляли собой одиночные гены или псевдогены U6, из них 52% (55 последовательностей) фланкированы короткими (12-20 пн) прямыми повторами и несут поли-(А) на своих 3'-концах. Другие 56 (35%) последовательностей U6 являлись химерными ретротранскриптами, сходными с изображённым на Рис. 1.4.4. Все такие химеры U6-3'-L1 фланкированы прямыми повторами длиной 11-21 пн, что свидетельствует об интеграции химеры как единой последовательности. Как и у химеры U6-L1 10p13, все они имели рядом со своими 5'- концами либо гексануклеотид TTAAAA, либо его производные с однонуклеотидными заменами A/G либо T/C.
Перечисленные выше особенности сайтов интеграции химер свидетельствуют о том, что их внедрения в геном были произведены интеграционным аппаратом ретротранспозонов L1.
Далее встал вопрос, имеют ли все эти химеры U6-L1 общую предковую последовательность, либо же всякий раз они формировались заново, в ходе многих независимых событий. Существующие данные свидетельствуют в пользу второй гипотезы. Во-первых, структуры пограничных последовательностей на стыке U6- и L1- частей химер различаются во всех найденных химерах и, кроме того, L1-фрагменты разных элементов U6-L1 принадлежат к различным семействам L1, образованным разными мастер-генами.
Рисунок 1.4.5. Корреляция между дивергенциями U6 u L1 частей химерных ретроэлементов U6-L1 от соответствующих консенсусных последовательностей. Количество представителей ретротранскриптов каждого типа дано в скобках.
На Рис. 1.4.5 показана практически линейная корреляция между значениями дивергенции U6-фрагментов химер от консенсуса U6 и дивергенции L1-фрагментов химер от консенсуса соответствующей группы L1. Эти значения дивергенции отражают возраст соответствующих ретротранскриптов. Наиболее молодые и наименее дивергировавшие (различие с консенсусной последовательностью 0-2%) U6 элементы оказались объединены с представителями L1 молодых семейств - L1PA3, L1PA2 и L1Hs. Напротив, более (3_8%) дивергировавшие последовательности U6 соединены с членами более старых семейств L1 - L1PA4, L1PA5, L1PA6, L1PA7 и L1PA8.
Наконец, наиболее (8_15%) дивергировавшие и, значит, старейшие, U6- фрагменты химеризованы с членами старейших семейств L1 - L1PA10, L1PA13, L1PA14, L1MB, L1MA4. Эта корреляция также доказывает, что в ходе эволюции происходило много независимых событий объединения U6 и L1, и что разные мастер-гены L1, функционировавшие каждый в свой временной период, участвовали в химеризации и интеграции ретротранскриптов U6_L1. Возраст старейших семейств L1, входящих в состав химер, составляет по крайней мере 100 миллионов лет (279), что подразумевает длительную эволюционную историю образования элементов U6-L1.
Самым простым механизмом образования химер могла бы быть интеграция копий U6 вплотную к 5'- концам предсуществующих 5'- укороченных L1, или наоборот, интеграция L1 сразу за 3'-концом геномной копии U6. В обоих случаях внедрившийся элемент (т.е. U6 или L1) должен быть фланкирован прямыми повторами, один из которых должен лежать на границе фрагментов U6 и L1. Но ни один из 56 химерных элементов не имел в своём составе такого повтора.
Химеры могли также возникнуть при интеграции L1 на определённом расстоянии ниже внедрения U6, и последующей транскрипции, инициированной промотором U6 и терминированной на сигнале полиаденилирования L1, сплайсинге РНК между 3'_ концом U6 и сайтом в составе L1, и, наконец, обратной транскрипции и интеграции сплайсированной копии РНК. Хотя этот механизм и объясняет отсутствие повтора между частями U6 и L1, он слабо соответствует тому факту, что все U6-фрагменты химер объединены с L1-частями химер в разных точках последовательности L1. Чтобы объяснить наличие множества случайных точек объединения, необходимо допустить случайное распределение большого количества криптических акцепторных сплайс-сайтов вдоль последовательности L1. Кроме того, такой механизм подразумевает крайне неэффективную (280) транс-комплементацию химерного транскрипта белками ретропозиционно-компетентного L1.