Биоинформатика и омиксы
Биоинформатика и мультиомики
Статистическая природа интеграции омиксных данных — разная модель шума в каждом слое, неслучайные пропуски, батч-эффекты, спутанные с биологией, и объём выборки, которого на самом деле требует арифметика.
Каждый омиксный слой измеряет свою физическую величину своим прибором, и различия между ними не исчезают при объединении таблиц. Число прочтений транскрипта — небольшое целое, полученное процессом выборки; содержание белка — отношение интенсивностей ионов в логарифмической шкале; метилирование — ограниченная доля; пик метаболита — интенсивность, которой может не соответствовать ни одна опознанная молекула. Интеграция трудна не из-за незрелости программ, а потому что это несоизмеримые измерения системы, слои которой связаны механизмами с разными характерными временами.
У каждого слоя своя структура шума
Счётные данные секвенирования переразбросаны относительно пуассоновских: биологическая изменчивость добавляет составляющую дисперсии, растущую как квадрат среднего, — поэтому в основе анализа дифференциальной экспрессии лежат счётные, а не нормальные модели. Интенсивности масс-спектрометрии приблизительно логнормальны, но ограничены снизу порогом детекции. Метилирование на микрочипе ограничено с обеих сторон и гетероскедастично у границ. Метод, который приводит всё к общей шкале и вводит одно предположение о дисперсии, выбрасывает ровно ту информацию, которая делала каждое измерение достоверным.
Пропуски неслучайны
Слои расходятся и в том, что означает пустая ячейка. В одноклеточном секвенировании РНК ноль чаще отражает глубину выборки, а не отсутствие транскрипта. В масс-спектрометрии пропуск обычно цензурирован слева — пептид присутствовал, но ниже порога детекции, — и вероятность пропуска зависит именно от той величины, которую вы оцениваете. Заполнение таких ячеек методом, безразличным к слою (среднее по столбцу, ближайшие соседи), вносит систематическое смещение, которое затем проходит через все последующие корреляции.
Батч-эффекты, спутанные с биологией
Самая частая ошибка опубликованных интеграций — не статистическая, а структурная. Если случаи обработаны в одном запуске, а контроли в другом, никакая коррекция не отделит партию от условия: это одна и та же переменная. Коррекции, которые в таких схемах кажутся работающими, обычно удаляют вместе с технической вариацией и настоящий биологический сигнал. Защита — планирование эксперимента: рандомизация порядка образцов между запусками, распределение условий по планшетам и дорожкам, связующие повторы, — а не более удачный алгоритм постфактум. Если схема была зафиксирована до прихода аналитика, честный отчёт говорит, что эффект неидентифицируем.
Арифметика мощности
Мультиомики умножают признаки, а не образцы. Исследование на пятидесяти участниках со ста тысячами измеренных признаков проверяет несопоставимо больше гипотез, чем имеет независимых наблюдений, поэтому при поправке на множественность оно способно обнаружить только очень крупные эффекты. Межслойные корреляции, найденные в таких данных, часто не воспроизводятся, а число возможных парных связей между двумя слоями растёт как произведение числа признаков. Полезная дисциплина — заранее указывать, какой размер эффекта схема вообще способна различить, и считать результаты интеграции порождающими гипотезы, пока их не подтвердит независимая когорта.
Всё это не делает интеграцию бессмысленной. Но ценность обычно возникает там, где один слой ограничивает другой — например, доступность хроматина расставляет приоритеты среди различий экспрессии, — а не там, где от совместной модели ждут откровения, недоступного ни одному слою.