Искусственный интеллект против мутаций

Материалы подготовил Кирилл Стасевич

Мутации бывают полезные, нейтральные и вредные. Можно ли заранее определить характер мутации?

Мутации бывают полезные, нейтральные и вредные. Можно ли заранее определить характер мутации? Если она попала в последовательность, которая кодирует белок, то её эффект на организм в целом определяется тем, что произойдёт с мутантным белком. В белковых участках генома закодирована последовательность аминокислот, от которой зависит пространственная структура белка, а от его пространственной структуры, в свою очередь, зависит его функция. По трёхмерной форме белка можно предсказать его функцию, если она ещё неизвестна. Мутации, которые приводят к аминокислотным заменам, могут быть практически незаметными для трёхмерной структуры белковой молекулы, а могут, наоборот, сильно её нарушить. Для хорошо изученного белка и хорошо изученного организма вполне реально предсказать, чем обернётся та или иная мутация.

Недавно такой эксперимент провели с бактериофагом ΦX174, который инфицирует бактерии кишечной палочки. Казалось бы, этот вирус изучен более чем хорошо. Его геном в виде кольцевой одноцепочечной ДНК ещё в 70-е годы прошлого века оказался первым, который сумели прочесть — секвенировать. Также геном ΦX174 стал первым, который химически синтезировали с нуля, — во многом благодаря тому, что он очень невелик, всего 5386 букв-нуклеотидов. Наконец, в августе этого года в Science была опубликована статья с описанием искусственных вирусов, которые на основе ΦX174 сгенерировал искусственный интеллект, причём комбинации ИИ-сгенерированных фагов поражали штаммы бактерий, устойчивые к обычному ΦX174. И вот недавно на портале bioRxiv появилась статья1, авторы которой трижды мутировали у ΦX174 каждый нуклеотид в ДНК (поскольку нуклеотидов всего четыре: А, Т, G и С, то любой из них можно заменить лишь тремя другими). Геном ΦX174 кодирует одиннадцать белков, и каждую аминокислоту в них меняли на девятнадцать других (в состав белков, как известно, входят двадцать аминокислот, хотя в последнее время в число обычных двадцати протеиногенных аминокислот включают две дополнительные, селеноцистеин и пирролизин). Получились десятки тысяч вариантов ΦX174, которые проверяли на кишечных палочках. Бактерии были чувствительны к фагу, так что любые проблемы, которые возникали у ΦX174 с размножением в бактериальной колонии, были обусловлены только его мутациями.

Примерно половина замен единичных нуклеотидов и около 60% замен аминокислот оказались для ΦX174 вредными.

Почему мутация может быть вредной? Белки постоянно с чем-то взаимодействуют, и мутация способна как раз нарушить свойства той части белковой молекулы, которая за эти взаимодействия отвечает. Молекулярный комплекс либо складывается как-то не так, либо вообще не складывается, в результате белок не работает как надо и вирус начинает хуже размножаться. Также мутация может разрушить всю структуру белка, превратив его в молекулярный мусор. Три четверти мутаций очевидным образом укладывались либо в первый сценарий, либо во второй. Для оставшихся объяснить их вредность оказалось намного труднее. Проблема в том, что хотя с ΦX174 работают не первое десятилетие, не для всех его белков есть полные и точные структуры. Сейчас исследователям пришлось прибегнуть к одной из последних версий программы AlphaFold2, которая представляет собой обучающуюся нейросеть, предсказывающую трёхмерную структуру белка по последовательности аминокислот (а её мы знаем из последовательности нуклеотидов, то есть из генетического кода). С помощью AlphaFold удалось понять механизм многих вредных мутаций, о которых поначалу не знали, что и думать.

Но AlphaFold был не единственным ИИ, использованным в работе. Чтобы оценить эффект мутаций, использовали два десятка нейросетевых обучающихся алгоритмов, которые предсказывали функции белков, по-разному работая с массивами белково-геномных данных. Некоторые программы анализировали только аминокислотные последовательности, другие оперировали одновременно последовательностями и данными о трёхмерной структуре белков, третьи давали свои предсказания с учётом эволюционных взаимосвязей между разными биологическими видами и их геномами и т. д. Получая мутантные последовательности фаговых белков, нейросети должны были указать, как меняется их функция при тех или иных аминокислотных заменах. Предсказания сравнивали с тем, что в действительности происходило с белками. Кроме того, в этом алгоритмическом «забеге» участвовал сравнительно более простой и не-нейросетевой метод, в котором состояние отдельного аминокислотного остатка в полипептидной цепи рассчитывали по его физико-химическим взаимодействиям с другими аминокислотами и окружающим раствором. Говоря иначе, этот метод позволял понять, что происходит с отдельным аминокислотным остатком в белке или белковом комплексе. Дальше уже можно было говорить о структурном состоянии всего белка и о том, как меняется его работоспособность. Оказалось, что этот не-нейросетевой подход сумели превзойти только две нейросетевые программы. То есть только две из них предсказывали эффект от мутации точнее, чем метод, в котором о функциональных изменениях судили по рассчитанным структурным изменениям.

Можно по-разному объяснить, почему суммарный ИИ показал такой скромный результат. Как ни странно, в том материале, на котором учатся соответствующие нейросети, сравнительно мало генетических последовательностей вирусов, особенно вирусов-бактериофагов. Кроме того, если говорить именно о функциях белков, то функциональные исследования не всегда в полной мере связаны с генетическими — они часто существуют как бы отдельно друг от друга, что затрудняет нейросетевое обучение. Как бы то ни было, новые результаты говорят, во-первых, о том, что даже давно известные объекты вроде фага ΦX174 в некоторых отношениях могут оставаться недоизученными. Во-вторых, старые исследовательские методы могут оказаться всё ещё более полезными, нежели ИИ, — по крайней мере, какие-то из его вариантов.

В начале сентября в The American Journal of Human Genetics вышла другая статья3 на ту же тему — как ИИ-предсказатели оценивают эффект от мутаций. Только тут уже ИИ-алгоритмы, числом более пятидесяти, анализировали примерно 13,5 млн мутаций в нескольких тысячах генов человека. Известно, что одни участки генома более подвержены мутациям, чем другие. С некоторых участков повышенной мутационности чаще начинается считывание генетической информации при транскрипции (то есть при копировании её в РНК) или репликации (то есть при удвоении ДНК). Белки, которые обслуживают эти процессы, либо сами ошибаются при работе с ДНК, либо она становится особенно подвержена каким-то мутационным воздействиям, пока с ней проводят те или иные операции. Бывает, что при исправлении одних дефектов в ДНК возникают другие. Также мутациям сильнее подвержены участки, по которым проходят рекомбинации, то есть обмены фрагментами между разными молекулами ДНК. В общем, причин тут достаточно, в их подробности углубляться не будем. И вот оказалось, что почти все ИИ-алгоритмы склонны переоценивать вред от мутаций там, где они встречаются редко, и недооценивать вред там, где они встречаются часто. В некоторой степени такой перекос можно объяснить тем, что ИИ-алгоритмы опираются, среди прочего, на эволюционные данные. Если определённый участок, который схож у нескольких родственных видов, мутирует редко, значит, он чем-то особенно важен. Мутации в нём дорого обходятся организму, а потому вымываются из популяции естественным отбором. Для участков, где мутации встречаются часто, всё происходит наоборот: эти участки важны в меньшей степени, поэтому мутации в них более позволительны. Всё так, однако при оценке эффекта от мутаций нужно учитывать не только общеэволюционную картину, но и биологическую функцию той последовательности ДНК, куда мутация попала.

На самом деле и у белковых молекул, и у клеток есть компенсаторные механизмы, позволяющие не обращать внимания на то, что в каком-то участке генома то и дело возникают мутации. Но даже с учётом этих механизмов в алгоритмических оценках мутационного вреда всё равно остаётся определённый перекос. Общий вывод, который тут можно сделать, состоит в том, что несмотря на оглушительные успехи ИИ он в некоторых областях науки остаётся инструментом, требующим доработки — в первую очередь в том, что касается данных, на которых его учат.

Комментарии к статье

1 Wei H., Li X., Lehner B. Complete Mutagenesis of the Genome and Proteome of ΦX174. bioRxiv 2026.07.25.740675.

2 Подробно о программе AlphaFold см. статью: А. Финкельштейн и др. Искусственный интеллект для физики белка. «Наука и жизнь» № 1, 2024 г.

3 Loay H., Kar P., Koch E., Seplyarskiy V., Weghorn D. Mutation rate heterogeneity biases variant effect prediction and reveals genuine mutational robustness. Am J Hum Genet. 2026 Sep 3:S0002-9297(26)00312-5.

 

Читайте в любое время

Портал журнала «Наука и жизнь» использует файлы cookie и рекомендательные технологии. Продолжая пользоваться порталом, вы соглашаетесь с хранением и использованием порталом и партнёрскими сайтами файлов cookie и рекомендательных технологий на вашем устройстве. Подробнее

Товар добавлен в корзину

Оформить заказ

или продолжить покупки