
Главная инновация кроется в архитектуре алгоритма. Традиционно нейросети переводят нуклеотиды (буквы A, T, G, C) в непрерывные числа для вычислений, а затем пытаются превратить результат обратно в последовательность. Этот двойной переход часто порождает критические ошибки, искажая итоговую цепочку. Новая разработка использует метод дискретного сопоставления потоков (Discrete Flow Matching). Алгоритм работает с текстом ДНК сразу, сохраняя его буквенную природу на всех этапах генерации.
Для обучения исследователи загрузили более 290 тысяч природных последовательностей: от человеческих промоторов до регуляторов клеток мозга дрозофилы. Тесты показали впечатляющие результаты. При создании новых промоторов система не уступила лучшим мировым аналогам, включая Fisher Flow Matching. На данных меланомы она стала абсолютным лидером среди потоковых методов, обойдя конкурентов по качеству синтеза энхансеров.
«Мы показали, что дискретный подход работает и конкурирует с ведущими методами генерации. Проектирование регуляторных участков напрямую, на уровне нуклеотидов, позволяет избежать ошибок, которые неизбежно возникают при переводе ДНК в непрерывное представление и обратно. В перспективе это даст возможность собирать промоторы и энхансеры с заданными свойствами — прицельно включать или тонко настраивать нужные гены в конкретных типах клеток. Именно такие инструменты востребованы в синтетической биологии и генной терапии, где активностью генов важно управлять с высокой точностью», – комментирует директор Центра биомедицинских исследований НИУ ВШЭ Мария Попцова.
Технология открывает путь к созданию искусственных биологических систем нового поколения. В будущем такие инструменты позволят проводить высокоточную генную терапию, точечно активируя нужные процессы в поврежденных тканях или подавляя патологические гены.














