Аналитика и PAT

Историки данных биопроцессов и аналитика

Сжатие временных рядов, выравнивание серий и латентно-факторная статистика: почему многомерная модель видит отклонения, недоступные ни одному уставочному пределу, и почему она всё равно не называет причину.

Ферментация в аппарате с мешалкой оснащена десятками каналов — температура, pH, растворённый кислород, обороты мешалки, углекислый газ в отходящем газе, подача субстрата, давление, масса, — но десятков независимых поведений в ней нет. Почти все каналы движимы одним и тем же малым набором причин: сколько сейчас биомассы, с какой скоростью она дышит, как на это отвечает регулятор. Измерения поэтому сильно коллинеарны, и именно эта избыточность делает архив исторических данных вообще пригодным для анализа.

Архив теряет данные по устройству

Историк хранит не каждый отсчёт. Он применяет сжатие с зоной нечувствительности (алгоритм «вращающейся двери»): новая точка записывается, только если сигнал отклонился от линейной интерполяции уже сохранённых точек больше заданного допуска. На медленном, хорошо отрегулированном контуре это отбрасывает огромные объёмы избыточных данных без потерь по существу. Но допуск задают при настройке тега — нередко за годы до того, как данные кому-то понадобятся, — и зона, достаточно широкая, чтобы тренд выглядел аккуратно, сотрёт ровно тот короткий выброс, который потом попытается восстановить расследование. А поскольку архив одновременно является записью GMP, параметры сжатия, источник меток времени и синхронизация часов — это не хозяйственная работа службы информационных технологий: от них зависит, удовлетворяет ли запись требованиям целостности данных по 21 CFR Part 11 и принципам ALCOA+.

Почему серии нужно выравнивать, прежде чем сравнивать

Записи серий образуют трёхмерный массив: серия — переменная — время. Многомерное статистическое управление процессом разворачивает этот массив и строит латентно-факторную модель: метод главных компонент или проекции на латентные структуры по траекториям серий — в постановке, которую Номикос и Макгрегор дали в середине 1990-х.

Неудобный шаг здесь — ось времени. Серии длятся разное число часов, поэтому выравнивание по календарному времени сопоставляет серию в середине экспоненциальной фазы с другой, уже вошедшей в стационарную. Выравнивают вместо этого по монотонному показателю зрелости — накопленному потреблению кислорода, проинтегрированной подаче — или методом динамической трансформации шкалы времени к эталонной траектории. Выбор этого показателя незаметно определяет, что модель впоследствии считает нормой.

Две статистики и что видит каждая

Обученная модель даёт две контрольные величины. Статистика Хотеллинга измеряет, насколько далеко серия ушла внутри той структуры корреляций, которую модель усвоила: необычно, но привычного рода. Квадратичная ошибка предсказания — остаток вне модели — измеряет отход от самой этой структуры: переменные перестали двигаться согласованно так, как двигались всегда. Именно вторая величина оправдывает метод, потому что отказ может разрушить связь между pH и потреблением кислорода, оставив оба параметра внутри их индивидуальных пределов.

Ограничение, которое никуда не денется

Эти модели корреляционные и обучены на прошлом производстве, где вариация мала именно потому, что регулирование хорошее. В отлаженном процессе мало возбуждения, поэтому модель интерполирует в узком коридоре, плохо экстраполирует, а отмеченное отклонение указывает, какие переменные внесли вклад в остаток, но не почему. Графики вкладов — начало расследования, а не причина. Причинные утверждения требуют спланированной вариации, вносить которую коммерческая кампания не вправе; поэтому понимание процесса по-прежнему приходит из моделей уменьшенного масштаба, а роль историка — обнаружение, а не объяснение.

Обновлено: