7. Подходы к повышению специфичности гибридизации нуклеиновых кислот
Будучи чрезвычайно полезными и информативными, многие методы, основанные на гибридизации нуклеиновых кислот, страдают от «фонового» отжига последовательностей геномных повторов, присутствующих в образцах. Такое “неправильное” спаривание приводит к нежелательной гибридизации неортологичных фрагментов ДНК, что приводит к образованию химерных клонов и значительно осложняет анализ получающихся библиотек. Химеры могут составлять 40-60% ДНК всей библиотеки. При этом количество химерных клонов прямо коррелирует со сложностью гибридизационной смеси. Специфичность гибридизации становится критичной для множества методов. В данной главе обсуждаются подходы к повышению специфичности гибридизации на стадиях реассоциации нуклеиновых кислот и селекции правильно спаренных гибридов. Для этого можно использовать подходы, основанные на химических модификациях, улучшении кинетических параметров гибридизации и повышении точности селекции совершенных дуплексов.
7.1 Введение
Множество популярных экспериментальных методов изучения генома и транскриптома, включая Клонирование совпадений и Вычитающую гибридизацию, основаны на гибридизации ДНК в растворе c последующей ПЦР амплификацией определённых гибридных фракций (65, 249).
Специфичность гибридизации - ключевой фактор, определяющий как точность многих природных биологических процессов, так и эффективность методов, основанных на гибридизации. Специфичность гибридизации, f, определяется как относительный фактор дискриминации совершенных против несовершенных дуплексов, согласно уравнению: f =exp-|?Gm-?mm /RT|, где Gm-?mm - это значение свободной энергии для связывания с участками, различающимися от идеально спаренного дуплекса единичной парой неспаренных оснований. Если значение Gm-?mm составляет ~4 kкал моль -1 (137), то специфичность гибридизации попадёт в диапазон ~1/100-1/1000, и теоретически возможно подобрать условия, при которых совершенные комплексы будут существенно более стабильны, чем дуплексы, содержащие неспаренные основания (122).
Впрочем, в реальности «неправильный» отжиг последовательностей друг на друга (в основном речь идёт о геномных повторах) создаёт существенные проблемы (250), и количество химерных клонов может составлять 40-60% библиотеки ДНК (Рис. 7.1).
Рисунок 7.1. Помимо образования совершенных дуплексов, в гибридизационной смеси также формируются химерные гибриды между повторяющимися последовательностями, особенно при работе с геномными смесями большой сложности. Многие методы не позволяют на предварительных стадиях распознавать такие “неправильные” гибриды, которые в таком случае могут занимать до 60% получаемых библиотек
Количество химерных клонов прямо коррелирует со сложностью гибридизационной смеси. Это, например, основное ограничение, которое не позволяет использовать вычитающую гибридизацию для прямого сравнения сложных геномов, таких, как ДНК млекопитающих. Оба основных подхода для вычитания геномной ДНК - RDA (representative differential анализ (54, 56, 57) и TGDA (targeted геномный difference анализ) (18, 19, 251), основаны на значительном упрощении фракции ДНК перед стадией гибридизации.
В первом случае такое упрощение достигается за счёт эффекта ПЦР селекции, когда тотальный пул фрагментированной геномной ДНК с лигированными адапторами предварительно амплифицируется в ходе 50-100 циклов ПЦР.
Это приводит к огромному отклонению в содержании различных фрагментов ДНК в получающемся ампликоне: большинство последовательностей оказываются недопредставлены или потеряны из-за относительно неэффективной ПЦР с Taq полимеразой, тогда как другие, образующие относительно небольшую (~10% или меньше) фракцию исходного пула, оказываются перепредставлены из-за своего оптимального для Taq полимеразы соотношения длины и GC-состава. Таким образом, RDA использует случайное упрощение геномной ДНК, основанное на размере и GC-составе фрагментов. Соответственно, в получаемом на выходе пуле дифференциальных последовательностей недостаёт большинства их, присутствовавших в геноме изначально. Поэтому RDA применим для поиска отдельных маркерных последовательностей, но не используется для исчерпывающего анализа геномов или кДНК.
Второй подход, TGDA, основан на предварительной специфической ПЦР амплификации группы интересующих геномных последовательностей (например, последовательностей, фланкирующих ретроэлементы человека с 5' или 3' конца (18, 19, 252)). Эти последовательности селективно амплифицируются с использованием разумного количества циклов (25-40, в зависимости от необходимости nested ПЦР амплификации), и подвергаются вычитанию, что приводит к созданию полной библиотеки, обогащённой дифференциальной ДНК. Преимущество TGDA - в полном, а не случайном, анализе интересующих типов последовательностей (различные группы повторяющихся элементов, члены мультигенных семейств, псевдогены, дуплицированные геномные локусы). На настоящий момент, метод был успешно применён для поиска дифференциальных внедрений эндогенных ретровирусов человека (19), а также ретротранспозонов L1 (251, 253, 254) и Alu (252).
Впрочем, оба подхода -TGDA и RDA - нельзя применять для сравнения полных геномов. Для улучшения существующих техник гибридизации нуклеиновых кислот в растворе, представляется целесообразным в дальнейшем:
- улучшать параметры кинетики гибридизации (чтобы образовывались только совершенные дуплексы и
- повышать селективность узнавания совершенных дуплексов на стадии изготовления итоговых библиотек.
7.2 Улучшение параметров кинетики гибридизации
Хотя кинетика наилучшим образом была исследована для вычитающей гибридизации (42, 43, 45, 61), все основные сделанные выводы оказываются верны и для других методов гибридизации нуклеиновых кислот в растворе.
При вычитающей гибридизации, ожидаемое обогащение дифференциальными последовательностями (Ed (t)) вычисляется по формуле (9, 42):
Ed (t ) = (1 +RD 0 t )/(1 +RT 0 t )
где R [M-1сек-1 ] - это константа скорости реассоциации, а D 0 и T 0 - это исходные молярные концентрации драйвера и трейсера, соответственно. Максимальное обогащение при t ? составит D 0 /T 0. Для ограниченных величин t, как, например, 14 часов (ночная инкубация), значение обогащения возрастает с ростом RD 0. Поэтому для получения наилучших результатов следует повышать значения R и D 0. Значение R можно повысить при использовании химических акселераторов, например, фенола (15, 23).
Однако же, геномы млекопитающих слишком сложны для получения высоких значений D0, и только огромные различия (вроде наличия или отсутствия У хромосомы) можно исследовать прямым геномным вычитанием. Как только размер генома становится выше 5x108 пн (сложность, сравнимая с геномами арабидопсиса и дрозофилы), кинетика гибридизации становится важнейшим фактором, ограничивающим обогащении целевыми последовательностями (45). В принципе, для улучшения кинетических параметров можно увеличивать время гибридизации, повышать концентрацию драйвера, увеличивать соотношения драйвер:трейсер и размер фрагментов ДНК, а также использовать методы повышения скорости реассоциации, например, метод реассоциации в фенольной эмульсии (PERT) (46);(48).
7.2.1 Упрощение гибридизационных смесей
Как было сказано выше, одна из схем геномного вычитания, (RDA) (57), включает ненаправленное уменьшение сложности трейсера и драйвера перед гибридизацией (54), при этом значение D 0 повышается за счёт случайного упрощения генома. Упрощение и повторение циклов вычитания позволяют добиться особенно высокого обогащения целевыми последовательностями (58). RDA успешно применяли для клонирования делеций и дупликаций ДНК при раке (69), а также для создания специфических генетических маркеров (58, 255). Альтернативный подход использованию огромного количества циклов ПЦР - упрощение смеси с помощью НЕчастощепящих рестриктаз, при этом получается скромное количество фрагментов, не слишком длинных для последующей амплификации.
Очевиден системный недостаток RDA - из смеси случайным образом отбирается небольшая фракция (2-10%), которая и анализируется, а все остальные последовательности - «выкидываются». Решение проблемы для случаев, когда известно, какие именно последовательности подлежат анализу -метод TGDA (19), при этом геном упрощается направленно, при предварительной амплификации целевых разновидностей сравниваемых последовательностей. Например, в случае, когда исследовалось семейство геномных повторов человека, содержащее 2000 членов, сложность гибридизационной смеси составляла всего 0.017% от общей сложности генома человека. Результат - весьма значительное повышение скорости гибридизации (3.6x107) упрощённой смеси относительно исходной (42).
Следующей проблемой является гораздо более высокая скорость гибридизации повторов, чем уникальных фрагментов генома (об этом см. более подробно в Главе 5). Частичное решение - пре-гибридизация с фракцией конкурентной ДНК, обогащённой повторами (для снижения их эффективной концентрации).
Кроме того, стоит принимать в учёт температуру гибридизации, которая в значительной мере является регулятором специфичности гибридизации: чем ниже температура, тем больше фон, и наоборот. Впрочем, начиная со значения 65єC, повышение температуры уже не влияет на специфичность гибридизации при размере фрагментов смеси порядка 100-300 пн (77). В частности, количество неверно спаренных дуплексов не отличалось для 65 и 85єC.
7.2.2 Химические модификации
Подходы, основанные на химических модификациях ДНК или синтезе аналогов нуклеиновых кислот, позволяют избирательно повышать или понижать стабильность комплементарных взаимодействий между основаниями, в зависимости от конкретной задачи. Это особенно важно для увеличения операционного интервала температур, дискриминирующих совершенные дуплексы от несовершенных (например, см. (256)). Последующее “титрование” температуры позволяет находить условия, обеспечивающие наибольшую специфичность гибридизации фрагментов геномной ДНК заданной длины.
Следующая группа подходов использует химическую модификацию оснований для дискриминации совершенных и несовершенных гибридов ДНК или РНК (190). Этот принцип в основном используется для детекции мутаций (188, 195) и подробно описан в Главе 6. При определённых условиях, возможно проводить специфические химические модификации неспаренных нуклеотидов, а затем, при расщеплении гликозидных связей по позициям модифицированных оснований, вызывать деградацию неверно спаренных гибридов. Основное преимущество такого подхода - практически 100% эффективность модификаций по неспаренным нуклеотидам, а главный недостаток - то, что модифицированные и расщепленные продукты не могут быть клонированы или ПЦР-амплифицированы.