Цифровые технологии и ИТ

ИИ-платформы дизайна и инжиниринга штаммов

Почему комбинаторное пространство метаболического пути нельзя обыскать эмпирически, чему модель способна научиться на нескольких сотнях штаммов и почему обученная на одном шасси модель плохо переносится на другое.

Метаболическая инженерия работает циклом: спроектировать генетическое изменение, собрать его, измерить, что делает клетка, извлечь урок и спроектировать снова. Программные средства сделали шаг проектирования почти бесплатным, а сборку — быстрой. Пропускную способность цикла поэтому задают измерение и обучение, и содержательный вопрос не в том, насколько хороша генеративная модель, а в том, сколько информации реально возвращает один оборот цикла.

Почему пространство нельзя обыскать

Возьмём скромный путь: десять генов, каждый из которых выбором промотора и сайта связывания рибосомы можно экспрессировать на пяти уровнях. Это пять в десятой степени — около десяти миллионов конструкций для одного пути, ещё без модификаций шасси, транспортёров и баланса кофакторов. Ни одна скрининговая кампания туда не дотягивается. Хуже того, поверхность отклика неаддитивна: эффект от повышения одного фермента зависит от потока через соседние, от доступности предшественника и от того, токсичен ли промежуточный продукт. Эпистаз такого рода означает, что измерение вклада каждого гена по отдельности не предсказывает комбинацию, и подход «по одному фактору за раз», работающий в химической технологии, здесь отказывает.

Именно поэтому настоящий продукт — модельно-управляемый дизайн библиотеки. Вместо случайной библиотеки модель, обученная на уже собранных штаммах, предлагает набор конструкций, выбранных ради информативности: они разнесены по той области пространства, где модель неуверенна, а не сгруппированы вокруг её текущего лучшего предположения. Опубликованные в открытых программах метаболической инженерии обучаемые инструменты устроены именно так — они рекомендуют пакет на цикл, а не одну точку, потому что пакет соответствует тому, как штаммы на самом деле собирают и скринируют.

Шагу обучения не хватает данных

Типичная кампания даёт сотни охарактеризованных штаммов, изредка несколько тысяч. Для пространства описанного размера это крайне малая выборка, и выборка не чистая. Биологическое измерение титра штамма несёт клональную вариацию, эффекты положения лунки в планшете и дрейф условий культивирования между постановками; разница в десять–двадцать процентов между двумя конструкциями вполне может оказаться шумом. Поскольку модель не выучит сигнал меньше ошибки повторности, потолок обучения нередко задаёт точность скрининга, а вовсе не архитектура модели. Высокопроизводительные схемы меняют точность на количество, а селекция по росту или биосенсорный отклик — лишь суррогат того титра, который важен в биореакторе с подпиткой. Разрыв между условиями скрининга и условиями производства и есть место, где теряется значительная часть внешне улучшенных штаммов.

Перенос — нерешённая часть

Модели уровня белка обобщают лучше, чем модели уровня пути, потому что уложенная структура в основном определяется собственной последовательностью. С метаболической моделью не так. Смысл уровня экспрессии зависит от кодонового состава хозяина, от его пулов предшественников и кофакторов, от его собственной регуляции и от метаболической нагрузки, которую конструкция накладывает на рост. Перенесите дизайн из кишечной палочки в дрожжи или мицелиальный гриб — и выученные моделью соотношения перестают выполняться, одна лишь компартментализация меняет постановку задачи. На практике каждому шасси нужны свои данные; поэтому платформы строятся вокруг небольшого числа хорошо охарактеризованных хозяев, и накопленный однородно измеренный набор данных по одному шасси — тот актив, который действительно трудно скопировать.

Обновлено: