Все клетки человека содержат один и тот же геном, но он работает совершенно по-разному в каждой из них. Одни производят ферменты, другие — гормоны, третьи формируют прочный каркас костей и соединительной ткани. Разница возникает не в самих генах, а в том, когда и с какой интенсивностью они включаются и работают. Ответ на этот фундаментальный вопрос биологии давно интересовал учёных. Теперь исследователи из Калифорнийского университета в Сан-Диего нашли новый способ раскрыть его, применив искусственный интеллект.
Под руководством профессора Джеймса Т. Кадонаги команда использовала машинное обучение, чтобы расшифровать критические «пусковые» участки ДНК — инициаторы, которые отмечают то место, где начинается прочтение гена. Исследование возглавил аспирант Торрей Райн-Кэрриг, который вместе с коллегами провёл высокопроизводительное секвенирование примерно полумиллиона вариантов инициаторных последовательностей и обучил модель машинного обучения распознавать их характерные паттерны. Результаты показали, что активный инициатор присутствует примерно в 60% сосредоточенных промоторов человеческих генов — это выше, чем предыдущие оценки, которые были основаны на поиске похожих последовательностей и составляли около 40–56%. Новая цифра более надёжна, так как основана на экспериментальных измерениях, а не на простом поиске по шаблону.
Полученная модель впервые позволила с высокой точностью предсказывать наличие инициаторов в геноме и расшифровывать минимальную функциональную последовательность, необходимую для старта транскрипции. Это означает, что учёные теперь могут смотреть на участок ДНК и сказать, будет ли он работать как активный инициатор — такой инструмент был невозможен раньше.
Открытие имеет серьёзный практический смысл. Мутации в инициаторах нарушают нормальную активацию генов и могут способствовать развитию заболеваний, включая онкологические. Новая модель позволяет оценивать влияние таких изменений до проведения экспериментов на живых клетках — это экономит время, ресурсы и помогает врачам точнее прогнозировать последствия мутаций для каждого конкретного пациента. Кроме того, расшифрованная сигнатура инициатора открывает путь биотехнологам к созданию синтетических промоторов с заранее предсказуемыми свойствами для направленной терапии и генной инженерии.
Человеческий геном содержит примерно 3 миллиарда пар оснований — это огромная инструкция, в которой зашифрованы правила: где, когда и в каком количестве должен работать каждый из 20 000–25 000 генов. Инициатор — это только один из многих регуляторных элементов, которые управляют этим процессом. Модель, обученная на инициаторах, — это первый шаг в расшифровке молекулярного «языка» регуляции. Учёные отмечают, что в будущем планируют расширить исследование на другие важные регуляторные элементы генома: энхансеры (которые усиливают активность генов) и сайленсеры (которые подавляют их), — чтобы составить полную картину того, как включаются и выключаются гены в разных клетках.
Исследование, опубликованное в авторитетном журнале Genes & Development 31 июля 2026 года, представляет собой важный шаг в многолетней работе по построению полного искусственного интеллекта для расшифровки кода экспрессии человеческих генов — полного набора инструкций, которые определяют, какие гены включаются, когда и в каких клетках. Практическое применение уже просматривается в ближайшей перспективе: врачи смогут точнее прогнозировать последствия мутаций, а биотехнологи получат инструмент для конструирования искусственных регуляторных последовательностей с заданными свойствами.
Понимание механизмов, которые решают, какой ген «включить» в нужный момент и в нужном количестве, приближает нас к более точной персонализированной медицине. Это помогает ответить на фундаментальный вопрос биологии: почему одна и та же ДНК порождает такое невероятное разнообразие клеток, тканей и органов в едином организме.


