Биоинформатика и омиксы

Секвенирование длинных прочтений

Ионный ток нанопоры и кольцевой консенсус PacBio как разные модели ошибок; почему повторы, структурные варианты и фазирование разрешает длина прочтения, а не точность; и что означают сырая и консенсусная точность.

Короткочитающее секвенирование даёт очень точные фрагменты примерно в сотню оснований. Его ограничение — не точность, а неоднозначность: прочтение короче повторяющегося элемента невозможно разместить однозначно, поэтому любой признак длиннее прочтения выводится, а не наблюдается. Длинночитающие платформы меняют точность на основание на прочтения длиной от килобаз до мегабаз, и именно этот обмен снимает неоднозначность.

Два разных физических измерения

Нанопорное секвенирование протягивает одиночную нить ДНК через белковую пору под приложенным напряжением и записывает ионный ток, который меняется в зависимости от нескольких оснований, находящихся в сужении в данный момент. Программа распознавания — на практике нейронная сеть — переводит след тока обратно в последовательность. Поскольку сигнал зависит от окна оснований, классическая трудность — гомополимерные участки: пять одинаковых оснований и шесть дают почти одинаковый ток, поэтому ошибки характерно являются вставками и делециями в низкосложных участках. Длину прочтения ограничивает прежде всего то, насколько целой молекула переживает выделение и нанесение.

Одномолекулярное секвенирование в реальном времени от PacBio, наоборот, наблюдает, как полимераза встраивает флуоресцентно меченные нуклеотиды в волноводе нулевой моды — лунке настолько малой, что освещён лишь активный центр фермента. Отдельные события встраивания шумны, но матрицу замыкают в кольцо, и полимераза читает одну и ту же молекулу многократно. Усреднение этих проходов даёт прочтения кольцевого консенсуса, точность которых приближается к короткочитающей при сохранении длины: здесь точность покупается проходами полимеразы, а не длиной.

Сырая и консенсусная точность

Различие важно при чтении спецификаций. Сырая точность прочтения описывает одну молекулу; консенсусная — результат после объединения свидетельств: либо нескольких проходов по одной молекуле, либо покрытия множеством молекул одного локуса. Обе платформы сегодня сообщают консенсусные показатели, сопоставимые с короткочитающими при разумной глубине. Сырая точность продолжает править там, где работают с одиночной молекулой: при поиске варианта, присутствующего в малой доле молекул, или при разборе события, увиденного лишь однажды.

Что даёт длина

Повторы: сборки перестают распадаться, когда прочтения превышают длину повтора, — так стала возможной полная сборка человеческого генома от теломеры до теломеры, включая сегментные дупликации и центромерные массивы, непроходимые для коротких прочтений.

Структурная вариация: вставки, делеции, инверсии и транслокации килобазного масштаба читаются прямо внутри одной молекулы, а не выводятся из аномальных расстояний между парными прочтениями, — поэтому длинные прочтения находят на геном заметно больше структурных вариантов.

Фазирование: прочтение, накрывающее два гетерозиготных сайта, прямо показывает, какие аллели лежат на одной хромосоме, — гаплотипы наблюдаются, а не восстанавливаются статистически по популяционным данным.

Модифицированные основания: обе платформы чувствуют модификацию без бисульфитной обработки — нанопора потому, что метилирование меняет сигнал тока, PacBio потому, что оно меняет кинетику полимеразы, — и метилирование считывается в том же запуске, на той же молекуле и с привязкой к фазе.

Что ограничивает метод

Длинные прочтения требуют длинных целых молекул, поэтому чувствительным шагом становится выделение; деградированный клинический или природный материал ограничивает длину независимо от платформы. Глубина обходится дороже в пересчёте на основание, а аналитический стек не просто перенастроен, а другой. Разумный итог: длинные прочтения отвечают на вопросы о структуре и фазе, а короткие остаются эффективными для подсчёта.

Обновлено: