Применение глубокого обучения к некодирующим РНК долгое время упиралось в дорогостоящее препятствие: расшифрованных 3D-структур по-прежнему критически мало, хотя секвенаторы нового поколения непрерывно наполняют базы данных миллионами неаннотированных прочтений. Большинство классических вычислительных конвейеров компенсируют эту нехватку с помощью множественного выравнивания последовательностей (MSA). Однако этот ресурсоемкий костыль работает со сбоями, когда речь заходит о быстро эволюционирующих или изолированных (сиротских) транскриптах.

Чтобы устранить эту зависимость, исследователи опубликовали в журнале Nature Machine Intelligence бенчмарк-исследование модели NucleicBERT. Это самообучающаяся маскированная языковая модель, разработанная для извлечения богатых структурных представлений напрямую из одиночных невыровненных последовательностей РНК.

«Применение глубокого обучения сдерживается дефицитом структурных данных РНК, и остается неясным, какие именно биологические закономерности подобные модели способны восстановить исключительно из массива сырых последовательностей».

Обрабатывая единичные последовательности как самостоятельные строки, NucleicBERT полностью устраняет необходимость в предварительном выравнивании. Это дает R&D-командам в биофарме прямой и быстрый путь от сырых данных секвенирования к проверке функциональных гипотез.

Перевод нуклеотидного контекста через трансформеры

С технической точки зрения NucleicBERT адаптирует архитектуру маскированного языка BERT под биологический синтаксис. Модель предварительно обучается на масштабных массивах неразмеченных некодирующих последовательностей РНК: алгоритм маскирует случайные нуклеотиды и заставляет механизмы внимания трансформера восстанавливать дальние контекстно-зависимые взаимодействия пар оснований.

Такой режим предобучения структурирует сырые данные в связное латентное пространство. Ни разу не соприкасаясь с аннотированными 3D-структурами кристаллов, NucleicBERT вычисляет фундаментальные вторичные и третичные ограничения исключительно на основе статистической встречаемости нуклеотидов, фактически декодируя структурную грамматику из одномерных данных.

Эффективность в прикладных биологических задачах

При дообучении на бенчмарках по предсказанию функций и структуры NucleicBERT демонстрирует точность, сопоставимую с классическими алгоритмами множественного выравнивания (или превосходящую их), используя на входе лишь одиночные цепочки. Для руководства биотех-стартапов и фармкомпаний, оптимизирующих бюджеты на R&D, отказ от выравнивания радикально сокращает циклы вычислений in silico и позволяет отбирать наиболее перспективные мишени до запуска дорогостоящих лабораторных экспериментов.

Тем не менее практические ограничения сохраняются: чисто последовательностные языковые модели все еще подвержены галлюцинациям при генерации синтетических молекул вне известных эволюционных рамок и не могут полностью заменить валидацию в лаборатории. Однако в сфере компьютерного дизайна лекарств NucleicBERT доказывает: архитектуры трансформеров способны снять барьер нехватки структурных данных, превращая массивы некодирующей РНК в доступное поле для создания новых препаратов.

ИИ в здравоохраненииМашинное обучениеНейросетиСнижение затратПроизводительность