Цифровые технологии и ИТ
Облачные платформы агробиоинформатики
Статистическая генетика геномной селекции, причина ежепоколенного падения точности прогноза и объяснение того, почему узкое место агроинформатики — фенотипирование, а не вычисления.
Когда селекционная программа переезжает на общую инфраструктуру, интересен не вопрос о том, где стоят серверы. Интересно, что именно они считают, — потому что геномная селекция опирается на статистическое утверждение сильное, измеримое и быстро портящееся.
Прогноз без знания генов
Метод, предложенный Мойвиссеном, Хейсом и Годдардом в 2001 году, не пытается найти гены, управляющие признаком. Он подгоняет сразу все маркеры к обучающей популяции, которая и генотипирована, и фенотипирована, и выдаёт геномную оценку племенной ценности для любого родственника, у которого есть только генотип. Внизу лежит неравновесие по сцеплению: маркер предсказывает признак не потому, что он что-то делает, а потому, что расположен достаточно близко к причинному варианту и наследуется вместе с ним. Ничего биологического при этом не открывается. Используется корреляция между участками хромосомы — и именно поэтому подход работает на признаках, которыми управляют сотни локусов малого эффекта: урожайность, засухоустойчивость, срок до цветения. Маркер-опосредованный отбор по нескольким генам большого эффекта на таких признаках не работал никогда.
Почему точность — величина плавающая
Точность прогноза не свойство метода, а свойство популяции, на которой он обучен. Она растёт с размером обучающей выборки и с наследуемостью признака и падает с ростом эффективной численности популяции: чем разнообразнее популяция, тем больше в ней независимо расщепляющихся участков хромосом, эффекты которых приходится оценивать по тем же самым данным. Отсюда и практическое следствие: точность хорошо переносится внутри элитного селекционного пула и плохо — на неадаптированный генофонд или на другой вид.
Она ещё и деградирует. Каждый цикл рекомбинации разрушает ту фазу сцепления маркера с причинным вариантом, которую выучила модель, поэтому модель, обученная два-три цикла назад, предсказывает по связям, которых уже нет. Геномная селекция — это не модель, которую строят, а модель, которую переобучают каждый цикл на новых фенотипах. Взаимодействие генотипа со средой накладывает ту же дисциплину, только в пространстве, а не во времени: модель, подогнанная по одному набору участков испытаний, систематически промахивается в другом климате. Поэтому многосредовые схемы испытаний и явные средовые ковариаты входят в саму модель, а не добавляются после.
Узкое место — измерение, а не счёт
Стоимость секвенирования упала на порядки; стоимость оценки делянки на полегание, поражённость болезнью или биомассу — нет. Полевая феномика (съёмка с беспилотников и наземных платформ, спектральные индексы как косвенные меры хлорофилла и обводнённости полога) закрывает именно этот разрыв, и каждый такой косвенный показатель нужно откалибровать по разрушающему эталонному измерению, прежде чем пускать его в модель.
Два вычислительных ограничения здесь по-настоящему биологические. Геномы полиплоидных культур трудны вполне конкретным образом: мягкая пшеница гексаплоидна, около 16 Гб, с очень высокой долей повторов, поэтому короткие чтения картируются неоднозначно между почти идентичными субгеномами, и выявление вариантов превращается в задачу отнесения к субгеному. А референсный геном — движущаяся мишень: координаты смещаются между версиями сборки, и результаты сопоставимы только тогда, когда конвейер, его контейнер и его референс записаны вместе. Ровно на это есть отраслевые стандарты: MIAPPE для метаданных фенотипирования, Crop Ontology для определений признаков и BrAPI для обмена данными между системами. Они и отличают общую платформу от общего диска.