# Биокомпьютинг и ДНК-вычисления

Почему хранение данных в ДНК выигрывает по плотности и проигрывает по стоимости записи и времени доступа — модели ошибок синтеза и секвенирования, произвольный доступ через ПЦР и честное сравнение с магнитной лентой.

ДНК — выдающийся архив и плохой компьютер, и причины этому физические.

Source: https://bioecon.ru/docs/synbio-enabling/bioinformatics-omics/biocomputing-dna-computing/
Updated: 2026-09-06



ДНК хранит информацию с плотностью, недостижимой ни для одного инженерного носителя, потому что информация записана в ковалентной структуре молекулы шириной около двух нанометров. Грамм ДНК в принципе вмещает порядка сотен петабайт, а сухая ДНК в холоде и темноте остаётся читаемой веками — последовательности извлекали из образцов вечной мерзлоты возрастом в десятки тысяч лет. Эти два свойства, плотность и долговечность, и составляют всё обоснование технологии. Остальное — недостатки.

## Узкое место — запись

Читать ДНК стало дёшево, писать — нет. Фосфорамидитный синтез добавляет одно основание за химический цикл с выходом ниже единицы, поэтому доля продукта полной длины падает геометрически с длиной. Именно поэтому схемы хранения режут данные на олигонуклеотиды длиной от сотни до нескольких сотен оснований, каждый со своим индексом, а не пишут одну длинную нить. Стоимость основания при синтезе падала намного медленнее стоимости секвенирования, и этот разрыв — многие порядки величины между синтезом и любой обычной операцией записи — объясняет, почему хранение в ДНК неконкурентно нигде, кроме холодных архивов, которые пишут один раз и читают редко. Ферментативный синтез с матрично-независимыми полимеразами — основной путь, которым пытаются это изменить; результат пока не устоявшийся.

## У ошибок два источника

Синтез даёт замены и, что характерно, вставки и делеции от несостоявшихся или двойных присоединений; гомополимерные участки хуже прочих. Секвенирование добавляет собственные ошибки, разные по характеру у разных платформ. Трудный класс — именно вставки и делеции: они сдвигают рамку чтения полезной нагрузки и разрушают побайтовое выравнивание, на которое рассчитаны классические блочные коды. Поэтому практические системы сочетают ограниченные кодировки — без длинных гомополимеров и без крайних значений GC-состава, которые плохо синтезируются и плохо читаются, — с внешними кодами стирания по множеству олигонуклеотидов и внутренними кодами внутри каждого, и опираются на многократное прочтение каждого фрагмента для построения консенсуса. Это работает: опубликованные демонстрации восстанавливали файлы целиком из пулов со значительной частотой ошибок на основание и с полной потерей заметной доли последовательностей.

## Произвольный доступ и разрушающее чтение

Пул ДНК не адресуем. Извлечение идёт через ПЦР с праймерами, уникальными для файла, которые амплифицируют нужное подмножество из смеси, — поэтому адресное пространство ограничено тем, сколько пар праймеров могут сосуществовать без перекрёстной гибридизации, и каждое обращение расходует часть образца и требует повторной амплификации. Задержку задают химия и время секвенирования: часы, а не миллисекунды.

## Где это неконкурентно

Против магнитной ленты ДНК с большим отрывом проигрывает по стоимости записанного байта, по пропускной способности записи и по времени доступа; выигрывает по объёмной плотности и по сроку хранения без периодической миграции. Ленточные библиотеки требуют перезаписи примерно раз в десятилетие по мере старения форматов и носителей, и эта повторяющаяся стоимость — честная точка сравнения. ДНК — кандидат для архивов огромных, редко читаемых и рассчитанных пережить несколько поколений оборудования. Она не кандидат на рабочее хранилище, и заявления о замене обычных носителей обычно обходят разрыв в стоимости записи.

Смежное направление — генетические схемы, логика на транскрипции и трансляции внутри живой клетки, — отдельная линия, полезная там, где вычисление должно происходить там же, где клетка, а не там, где важна скорость.

