Вернуться ко всем конспектам

Нобелевская премия по химии 2024: как нейросети научились сворачивать белки

Разбор Нобелевской премии по химии 2024 года, присуждённой Дэвиду Бейкеру, Демису Хассабису и Джону Джамперу за предсказание и дизайн структуры белков. В материале объясняется, почему задача сворачивания белка десятилетиями считалась нерешаемой, как AlphaFold от DeepMind поднял точность предсказаний с 30 % до 90 % и выложил в открытый доступ 200 миллионов структур, а программа Rosetta научилась конструировать белки под заданную функцию. Отдельно разбираются слабые места нейросетей — гетероолигомеры, докинг, влияние мутаций — и обоснованность упрёков в том, что премию дали «авансом». В финале — размышления об избыточности как принципе живого, эволюции как переборе с отбором и ответы на вопросы зрителей.

Ирина Якутенко
Смотреть видео

Нобелевская премия по химии 2024: предсказание и дизайн структуры белков

Кому и за что вручили премию

  • Премия по химии в этом году, по сути, присуждена за биологию и вычислительные науки — как и премия по физике, она связана с нейросетями.
  • Лауреатов трое:
    • Дэвид Бейкер — половина премии (за создание белков «с нуля», дизайн новых структур);
    • Демис Хассабис и Джон Джампер — вторая половина (компания DeepMind, ныне часть Google).
  • Формулировка: за разработку методов, позволяющих предсказывать структуру белка по его аминокислотной последовательности и решать обратную задачу — подбирать последовательность под нужную структуру.
  • Показательно, что крупные корпорации теперь «проникли» и в Нобелевские премии: в DeepMind объявление лауреатов встретили как большой праздник.

Почему белки так важны

  • ДНК хранит информацию, но все функции в организме реализуют белки — это «универсальные солдаты» живой клетки.
  • Белки катализируют реакции (ферменты часто эффективнее и точнее химических катализаторов), отвечают за мышцы, пищеварение, рост и практически за всё остальное.
  • Их специфичность колоссальна: во время пандемии COVID-19 было видно, как замена одной аминокислоты в спайк-белке лишала антитела способности его узнавать.
  • Практические приложения очевидны:
    • разработка лекарств и понимание, с какой точностью белок узнаёт свой лиганд;
    • расшифровка механизмов заболеваний, связанных с дефектными белками;
    • изучение бактериальных токсинов и ферментов (например, расщепляющих антибиотики);
    • конструирование новых белков «под задачу» — например, разрушающих компонент бактериальной клетки.

Проблема сворачивания белков

Что такое структура белка

  • Первичная структура — линейная цепочка из 20 аминокислот, сотни звеньев («бусы»).
  • Вторичная структураальфа-спирали и бета-складки (бета-листы), базовые структурные элементы.
  • Третичная структура — итоговая сложная трёхмерная «запутанная» конфигурация, похожая не на аккуратный клубок, а на спутанные провода. Именно она и есть реальный белок.
  • В третичной структуре аминокислота №3 может контактировать с аминокислотой №215 — далёкие по последовательности участки сближаются и вместе формируют, например, активный центр фермента.

Парадокс Левинталя

  • Учёные рано заметили: белок сворачивается всегда одинаково. При денатурации (например, нагреванием) цепочка разворачивается, а при возвращении подходящих условий ренатурирует в ту же конформацию.
  • Однако в 1969 году Сайрус Левинталь подсчитал, что маленький белок из 100 аминокислот теоретически может принимать не менее 10⁴⁷ трёхмерных конформаций — величина, сопоставимая с числом атомов во Вселенной.
  • Реализуется же одна, максимум две. Это давало надежду: существуют физические правила сворачивания, и, поняв их, можно научиться предсказывать структуру.

Исключение: прионы

  • Прионы — белки с двумя предпочтительными конформациями: нормальной и «вредительской».
  • Неправильно свёрнутый прион заставляет другие белки перестраиваться так же — идёт цепная реакция.
  • Отсюда болезни куру («пляшущая смерть» в Папуа — Новой Гвинее) и Крейтцфельдта — Якоба. Но даже здесь конформаций две, а не 10⁴⁷.

Экспериментальные методы и их ограничения

  • Долгое время единственным способом узнать структуру был рентгеноструктурный анализ: выращивание кристалла белка, съёмка, восстановление структуры по картине рассеяния.
  • Метод точный, но:
    • крайне трудоёмкий, «больше похож на искусство, чем на метод»;
    • многие белки не кристаллизуются вовсе;
    • в кристалле белок может терять нативную конформацию, и полученная структура не отражает его вид в клетке.
  • Позже добавилась криоэлектронная микроскопия.
  • Кристаллографы годами публиковали по три статьи на один белок, постепенно улучшая разрешение — и именно они сегодня чаще всего высказывают скепсис по поводу новой премии.

Первые вычислительные подходы

  • С развитием компьютерного анализа стали видны закономерности (паттерны) в последовательностях: аминокислоты различаются по свойствам (полярные/неполярные, заряженные, гидрофильные/гидрофобные, большие/малые).
  • Определённые паттерны надёжно предсказывают альфа-спираль или бета-складку — эти предсказания подтвердились синтезом коротких пептидов.
  • Были понятны и общие правила третичной укладки: гидрофобные остатки прячутся внутрь, полярные и заряженные выставляются наружу, в водное окружение.
  • Но от этих общих правил до полной структуры было «как до Луны пешком».

Соревнование CASP как двигатель прогресса

  • CASP (Critical Assessment of Protein Structure Prediction) — конкурс, где участникам дают последовательности новых, ранее неизвестных белков, а предсказания затем сравнивают с реально определёнными структурами.
  • Долгие годы результат «топтался на месте»: точность порядка 30 % в 2007, 2010 и 2014 годах — это не приближало к решению задачи.
  • Один из ранних приёмов улучшения — переход от сложных алгоритмов (метод Монте-Карло и др.) к массированному перебору вариантов («грубой силе»), что дало небольшой, но значимый прирост.

Прорыв DeepMind

AlphaFold 1 (CASP13, 2018)

  • В конкурс вошёл Демис Хассабис, основатель DeepMind. Изначально компания занималась не биологией, а играми: их модель AlphaGo обыграла сильнейших людей в го и шахматы.
  • Хассабис заинтересовался биологией (по его биографии — после прочитанной книги) и решил применить свои подходы к белкам.
  • AlphaFold 1 сразу поднял точность примерно до 60 %. Это вызвало энтузиазм, но для практики не годилось: 40 % ошибок не позволяли отказаться от экспериментальных методов.

Почему нейросети «выстрелили»

  • Ключевой принцип — огромная обучающая выборка и многократное «скармливание» данных модели, которая обучается за счёт своей слоистой архитектуры.
  • Прорыв в ИИ (например, AlexNet) стал возможен, когда видеокарты резко нарастили вычислительные мощности и позволили обучать модели с миллиардами параметров.
  • Важны и архитектуры — свёрточные сети, трансформеры, — но без больших данных они бесполезны.
  • Это не тупой перебор: перебрать 10⁴⁷ вариантов невозможно ни за какое разумное время; сеть «идёт» в нужном направлении, обучаясь.

AlphaFold 2 (CASP14, 2020)

  • Не просто улучшение первой версии, а принципиально другая архитектура.
  • Точность выросла до ~90 % — результаты стали практически неотличимы от экспериментальных данных, полученных кристаллографией или криоэлектронной микроскопией.
  • Как это работает (упрощённо):
    • в модель загружается огромное количество гомологичных белков разных видов;
    • используется множественное выравнивание последовательностей — сеть сопоставляет родственные белки и находит сходные структурные участки;
    • для обучения нужны и последовательности, и уже известные экспериментальные структуры;
    • сеть выявляет соответствия между участками последовательности и элементами структуры и переносит их на новые белки.
  • Подробное (без формул) описание доступно в материале Advanced Information на сайте Нобелевского комитета, хотя оно скорее добавляет тумана, чем ясности.

Проблема интерпретируемости и побочные эффекты обучения

  • Общая для всех нейросетей, включая AlphaFold, сложность: сеть находит паттерны, недоступные человеческому взгляду, но мы часто не понимаем, каким путём она приходит к своему результату.
  • Наблюдается любопытный феномен: генеративные модели общего назначения (вроде GPT) играют в шахматы лучше, чем сети, специально созданные для шахмат.
  • Как именно это возникает, до конца непонятно — это своего рода побочный эффект архитектуры и процесса обучения: сеть многократно корректирует связи между слоями нейронов, используя полученную информацию, и приобретает неожиданные способности.

Подарок DeepMind научному сообществу

  • AlphaFold 2 появился в 2020 году — в разгар пандемии, поэтому широкая публика его почти не заметила, но среди биологов и структурщиков поднялся невероятный хайп («мы остались без работы»).
  • После победы AlphaFold соревнование CASP фактически потеряло смысл: победитель определился, и организаторы спрашивали «что дальше?».
  • В качестве жеста доброй воли Google/DeepMind прогнали через AlphaFold 2 все известные белковые последовательности — около 200 миллионов — и практически «за одну ночь» выложили полученные структуры в открытые базы данных.
  • Раньше считалось, что на экспериментальное определение этих структур уйдут тысячи лет. Теперь в базах есть не только последовательности, но и предсказанные структуры — «бери и работай».

Скепсис: премия «авансом»?

  • Часть научного сообщества сравнивает эту премию с Нобелевской премией мира Бараку Обаме — то есть данной не за уже сделанное, а за ожидаемое.
  • Формально заявлено, что решена «вечная проблема биологии»: определение формы белка по последовательности. Но по мере практической работы стало ясно, что задача решена не полностью.
  • Аналогия с ChatGPT: когда он появился, говорили, что журналистам и пиарщикам пора на выход. Пока не пора — хотя некоторых он уже пишет лучше.

Что AlphaFold 2 делает хорошо

  • Отлично предсказывает структуру небольших глобулярных белков. Достаточно загнать последовательность в бесплатный открытый сервис — и получить структуру без всякого эксперимента. Это проверялось прямыми сравнениями с «ручными» структурами.
  • Неплохо справляется с гомоолигомерами — белками из нескольких одинаковых субъединиц.
  • Активно используется на практике для ускорения и удешевления рентгеноструктурного анализа:
    • обычно для надёжной структуры нужен не один кристалл, а несколько наборов данных в разных условиях, либо трюки вроде замены метионина на селенометионин (введение более тяжёлых атомов);
    • второй набор данных часто получить невозможно — кристалл не растёт;
    • AlphaFold позволяет восполнить недостающую информацию по одному набору данных.
  • Многие практики в восторге: инструмент резко ускорил работу и позволил «достать с полок» старые данные и наконец получить по ним структуры.

Чего AlphaFold 2 не умеет

  • Гетероолигомеры — комплексы из разных белков — предсказывает с частыми ошибками.
  • Эффект мутаций предсказывать не умеет. Это критично: как показал COVID, замена одной аминокислоты обесценивает целые линейки моноклональных антител, которыми лечат людей с ослабленным иммунитетом; фармкомпании крайне заинтересованы в таком прогнозе.
  • Докинг (связывание белка с лигандом — лекарством или ингибитором) предсказывает плохо.
  • Не умеет предсказывать изменение структуры при связывании антигена с антителом.

Почему так — вопрос архитектуры и обучающей выборки

  • Модель не ищет истину — она выдаёт наиболее вероятный ответ исходя из того, чему её учили. Как языковая модель дополняет фразу «далеко-далеко на лугу пасутся ко...» словом «кони» или «кометы» в зависимости от предшествующего контекста, не понимая смысла.
  • Если в обучающей выборке много белков с определённой структурой, модель предскажет ту же структуру, даже если исследователь вставит в середину гидрофобную аминокислоту, которая эту структуру заведомо разрушит. Это встроенное смещение (bias).
  • Комплексов «белок + лиганд» с зафиксированным изменением конформации в обучающих данных мало — отсюда и слабость в докинге. Критика справедлива, но упрекать модель в том, чему её не учили, не вполне корректно.
  • Отдельно отмечается роль архитектуры: переход от свёрточных сетей к трансформерам оказался удачным для работы с белками, дальше появились диффузионные модели.
  • Попутное замечание: образ биолога как рассеянного натуралиста с сачком давно неактуален — в современной биологии работает огромное число математиков и физиков.

AlphaFold 3 и коммерческая логика

  • Нобелевские премии, как правило, не дают за закрытые коммерческие разработки. Пример: липидная оболочка мРНК-вакцин — ключевой элемент их работы — осталась под патентом Pfizer/BioNTech и Moderna, и её создатели премию не получили.
  • В случае AlphaFold 2 всё «чисто»: и модель, и 200 миллионов структур выложены в открытый доступ.
  • Однако уже существует AlphaFold 3 — он не в открытом доступе, доступен лишь ограниченным числом запросов через сайт, а с крупными фармкомпаниями, судя по всему, заключены контракты на неограниченный доступ.
  • По публикациям, AlphaFold 3 умеет ровно то, чего не хватает второй версии, — предсказывать взаимодействие белка с лигандом. Это именно то, что нужно для дизайна лекарств и новых антибиотиков (подобрать лиганд, который заблокирует «вредный» бактериальный белок).
  • Проверить эти заявления невозможно из-за закрытости модели. Но DeepMind — не благотворительная организация: коммерческая компания обязана зарабатывать, и «большого доброго государства», которое эффективно финансировало бы такие разработки, не существует.

Вторая половина премии: дизайн белков и программа Rosetta

Как работает Rosetta

  • Дэвид Бейкер решает обратную задачу: не «структура по последовательности», а подбор последовательности под желаемую структуру. Его инструмент Rosetta появился раньше AlphaFold, и Бейкер тоже участвовал в CASP.
  • Принцип работы:
    1. Программа «прочёсывает» имеющуюся базу белковых структур и находит нужные структурные элементы — альфа-спирали, бета-листы, определённые петли.
    2. Пользователь задаёт желаемую конфигурацию: «здесь такая спираль, здесь такой лист».
    3. Rosetta подбирает подходящие фрагменты реальных белков.
    4. Затем оптимизирует их взаимное расположение, чтобы при сворачивании фрагменты не разрушали структуру друг друга (иначе красивая альфа-спираль может развалиться при реальной укладке).
  • Уже в 2003 году Бейкер опубликовал первые результаты, и такие белки успешно синтезируются.

Почему это проще, чем кажется, и в чём предел

  • Искусственные белки получаются «квадратно-гнездовыми» — простыми по устройству и выполняющими несложные функции.
  • Хорошие ферменты создать не удаётся. Природный фермент — катализатор колоссальной эффективности; человеческие поделки рядом с ним не стоят.
  • Зато отлично получаются сенсоры: белок, прочно связывающийся с определённым веществом (опасным химикатом, наночастицей), позволяет точно детектировать и измерять его концентрацию в среде. Это простые структуры — и здесь метод работает превосходно.

Комбинация дизайна и направленной эволюции

  • Природа создаёт белки долгим эволюционным перебором: случайные мутации, отбор, тупиковые ветви (как у коронавируса, у которого одна мутация может «убить» функцию). Отсюда их запутанная, «клубок проводов», структура.
  • Человек мыслит линейно: сразу задаёт нужную функцию и конструирует под неё.
  • Поэтому применяют гибридный подход:
    1. Синтезируют белок по предсказанию Rosetta.
    2. Вносят в его ген случайные мутации (направленная эволюция — за неё тоже давали Нобелевскую премию).
    3. Бактерии (например, E. coli) синтезируют сотни вариантов.
    4. Отбирают тот, что работает лучше — иногда случайная мутация даёт конформацию удачнее рассчитанной.
    5. Цикл повторяют, проводя селекцию, как с растениями или сельскохозяйственными животными.
  • Так удаётся получать очень эффективные сенсоры и связывающие белки, а иногда и простые ферменты.

Урок для конспирологов

  • Эта премия наглядно показывает, на каком уровне находится наш белковый дизайн по сравнению с природным: мы способны сделать «лопату», тогда как природные ферменты сравнимы с синхротроном.
  • Отсюда следует нелепость версии, что коронавирус был создан с нуля в лаборатории: те, кто это утверждал, сильно переоценивают наши возможности. Показательно, что конспирологи затем переключились на версию «утечки» или ускоренной эволюции в лаборатории — потому что стала очевидна невозможность искусственного конструирования такого совершенного объекта.

Философское отступление: нейросети и принципы живого

  • Первые попытки предсказывать структуру белка были чисто алгоритмическими — задавались явные правила. Это не сработало: задача оказалась слишком сложной для «встроенной математической модели».
  • Нейросети в чём-то развиваются подобно живому: они самообучаются, многократно возвращаются к данным, корректируют предыдущие ответы, движутся к решению не прямо, а окольными путями.
  • Живое тоже никогда не идёт напрямую: природа пробует, отбрасывает неудачное, приходит к одному результату разными путями. Пример — рыба и дельфин: сходная обтекаемая форма достигнута совершенно разными эволюционными маршрутами (млекопитающее вернулось в море и заново приобрело «рыбий» форм-фактор).
  • Ничего удивительного: нейросети изначально были инспирированы устройством нейронов и мозга.

Избыточность как источник функциональности

  • Раньше считалось, что у человека избыточно много нейронов — «зачем столько связей, ты мог бы выучить 10 языков». Теперь ясно: эта кажущаяся избыточность и обеспечивает вычислительную мощность.
  • Тот же принцип в геноме: 20 000 белков на миллиарды нуклеотидов казались признаком «мусорной ДНК». Но микроРНК и регуляторные последовательности показали, что это не мусор, а:
    • регуляторный аппарат;
    • ресурс для возникновения новых белков — избыточные фрагменты генов случайно сливаются, порождая иногда полезные структуры.
  • Вывод: кажущаяся избыточность и сложность — типичная черта живого. Мы видим лишь конечный, кажущийся совершенным продукт, тогда как процесс принятия решения всегда сложен и непрям.
  • Прорыв в нейросетях произошёл именно тогда, когда от «квадратно-гнездового» подхода (хочу шахматную программу — пишу правила для шахмат) перешли к частичной имитации принципов работы мозга — с избыточностью, повторами и «хождением по кругу».

Ответы на вопросы зрителей

Возможен ли «AlphaFold для психологии»?

  • Идея создать аналог AlphaFold, который предсказывал бы поведение человека и социума по особенностям мозга, пока нереалистична.
  • Мозг — это чёрный ящик, и нейросети тоже становятся для нас чёрным ящиком: мы уже не вполне понимаем, почему они работают именно так. Например, исследования памяти нейросетей показали, что они «помнят» больше, чем должны бы, — то ли конструируют, то ли восстанавливают информацию, и до конца непонятно, что там происходит.
  • Задача сложнее белковой: поведение зависит от миллиона факторов.
  • Была мода на поиск генов-кандидатов — «одна мутация делает тебя жадным/агрессивным». Такие случаи крайне редки: пример — ген MAOA, чётко связанный с агрессией у мужчин. Обычно же на каждый признак влияют сотни генов.
  • Характер складывается из сотен черт, каждая из которых определяется сотнями генов, — структура слишком сложна.
  • Отдельный аргумент — экономический: у AlphaFold 3 есть очевидное коммерческое применение (дизайн лекарств). Непонятно, откуда возьмутся деньги и прибыль на «AlphaFold для психологов». Если кто-то найдёт способ монетизации, возможно, такое и появится.

Сворачивание белка: почему AlphaFold иногда ошибается

Белок не «вычисляет себя». Утверждение, будто белок в процессе сворачивания «аналогово вычисляет сам себя», неверно: никаких вычислительных центров у белков нет. Однако вопрос затрагивает важную тему — механизм фолдинга.

Котрансляционное сворачивание:

  • Модели показывают белок так, будто он сворачивается одномоментно, целиком. В реальности всё иначе:
    1. На РНК (копию гена) садится рибосома.
    2. Она считывает триплеты-кодоны и ждёт, пока подплывёт нужная тРНК с соответствующей аминокислотой.
    3. Аминокислоты соединяются, как бусины, — цепочка растёт постепенно.
  • По мере выхода из рибосомы белок начинает сворачиваться уже в процессе синтеза — это называется котрансляционный фолдинг.
  • Следствие: сначала сворачивается первая часть, затем появляется вторая, взаимодействует с первой и меняет её конформацию, и уже изменённое состояние взаимодействует с последним участком.
  • Поэтому у сворачивания есть временнóе измерение: если бы белок сворачивался мгновенно, энергетически оптимальной была бы одна структура; при постепенном формировании оптимальной может оказаться совсем другая.

Редкие кодоны как «паузы»:

  • В генетическом коде есть редкие кодоны, для которых рибосоме приходится долго ждать нужную тРНК.
  • Есть работы, показывающие, что это не случайность: пауза даёт белку время свернуться в нужную конформацию.
  • Если бы аминокислота подошла слишком быстро, белок свернулся бы неправильно, и итоговая структура оказалась бы нерабочей.

Лиганды: белок часто работает не «сам по себе», а в связке с лигандом, который присоединяется в определённый момент и меняет структуру. Итоговая конформация тогда отличается от предсказанной моделью — ещё один источник ошибок.

Эволюция: перебор плюс отбор

  • Вычислений в живом нет, но эволюция «вычисляет» методом отбора: у неё практически бесконечное число попыток (хотя конкретный неудачный вариант может закончиться гибелью организма).
  • Популярное возражение — «бесконечное число обезьян с печатными машинками не напишет "Войну и мир"» — не работает, потому что у обезьян нет отбора. В эволюции случайные мутации направляются отбором.
  • Странно, что при обсуждении селекции (превращение дичков в культурные яблоки) силу отбора все признают, а применительно к эволюции — как будто забывают.

Пример: как из волков получились собаки

  1. Менее агрессивный волк (или волчонок, выросший рядом с людьми) держится ближе к человеческой стоянке ради объедков.
  2. Он находит такую же менее агрессивную пару; их потомство в среднем ещё чуть менее агрессивно.
  3. Люди оставляют при себе самых дружелюбных, кормят их — у тех выше шансы на выживание.
  4. Поколение за поколением отбор идёт на дружелюбие.
  • Вместе с поведением менялся и фенотип: животные уменьшились, зубы стали мельче.
  • Косвенное подтверждение — новосибирский эксперимент с лисами, где отбирали наиболее дружелюбных особей (хотя к нему есть вопросы, сама схема выглядит разумной).
  • Это наглядный ответ сторонникам «разумного дизайна»: эволюция видна в действии, никакого конструктора не требуется — нужны лишь множество попыток и отбор. При этом в биологии нет ничего стопроцентного, кроме смерти: речь всегда о вероятностях.

Искусственный и естественный отбор:

  • Искусственный отбор повторяет механику естественного, разница — в цели и направленности:
    • человек отбирает под свои нужды (посадил семечки самого сладкого яблока, повторил много раз — получил современные сорта);
    • природа «отбирает» на приспособленность к конкретным условиям, ниш много, направлений много, гарантий никаких — вид может не приспособиться и вымереть.
  • Это же различие видно в белковом дизайне: человек хочет гарантированного результата («соединю три складки и две спирали — получу нужную функцию»), а природа идёт витиевато, методом проб и ошибок.

Киноотступление

  • «Аннигиляция» — сюжет не блестящий, но визуально фильм отлично передаёт ощущение того, как развивается живое: оно пробует во все стороны, сами собой возникают щупальцеподобные структуры.
  • «Из машины» (Ex Machina) того же режиссёра — одна из лучших фантастических картин про искусственный интеллект.

Почему ответы порождают новые вопросы

  • Дело не во Вселенной, а в устройстве мозга: мы эволюционно заточены искать проблемы. Те, кто расслаблялся в условиях пещеры, хуже выживал и оставлял меньше потомства.
  • Отсюда вывод: идея «решу все проблемы и наступит блаженство» порочна — полный покой не наступит никогда.
  • Осознав это, перестаёшь гнаться за иллюзией, как собака за хвостом. Практический совет: раз проблемы всё равно будут искаться, лучше подкидывать себе интересные задачи, а не заниматься ерундой вроде «цвета штанов» или мечтой о «ванне с шампанским» — последнее ведёт к прокрастинации и деградации.

Короткие ответы на другие вопросы

  • Предсказание кристаллов (работы Артёма Оганова) — это другая область: там предсказываются структуры веществ при экстремальных условиях (например, давление в сотни атмосфер), с AlphaFold напрямую не конкурирует.
  • Достижения ГМО — тема возможна, но из-за запретов почти повсеместно достижений существенно меньше, чем хотелось бы.
  • Нобелевские премии за микроРНК — премий в этом году пока объявлено две, остальных ждём.
  • Эпигенетика — полноценная наука; автор писал по ней курсовую и диплом. Это ещё один уровень регуляции: помимо регуляции на уровне РНК (микроРНК) и белка, есть надстройки над ДНК, регулирующие активность генов. Система быстрой регуляции: например, при неправильном питании появляются эпигенетические метки на генах, связанных с метаболизмом. Открыта относительно недавно — примерно с 1980–90-х.

Нужно ли перепроверять 200 миллионов предсказанных структур?

  • Перепроверять все — бессмысленно. Мы уже знаем тенденции: какие типы белков модель предсказывает хорошо, а какие плохо.
  • Если конкретный белок выбран мишенью для разработки лекарства, его структуру всё равно будут проверять экспериментально — но AlphaFold и здесь упрощает работу (достаточно одного набора данных вместо нескольких).
  • Ошибки бывают, иногда критические — структура вообще не похожа на реальную. Но причины известны: котрансляционное сворачивание, гетероолигомеры, наличие лиганда. Такие белки можно рассматривать внимательнее или исключать из выборки.
  • Огромная польза — не только для практики, но и для фундаментальных исследований: сравнительный анализ структур, изучение эволюции белков у разных видов (какие функции приобретались и терялись), молекулярные часы, закономерности изменений генома.

Аналогия с машинным переводом

  • Пример ABBYY: компания годами билась над «проблемой смысла», считая, что качественный перевод невозможен без понимания. Затем вышел ChatGPT, который смысла не понимает и сознания не имеет, но переводит достаточно хорошо для бытовых задач.
  • Вывод тот же: если нужно быстро обработать большой объём текста на незнакомом языке, результат нейросети более чем удовлетворит цели. Так же и с базой из 200 миллионов структур — для простых белков она работает прекрасно.

Трансгуманизм и дизайн организмов: как до Луны пешком

  • Полноценный дизайн организмов и органов, а тем более бессмертие, — очень далёкая перспектива. Крейг Вентер пытался создать минимальный организм, но до сложных биологических конструкций ещё далеко.
  • Причина: у природы условно бесконечное число попыток, а человек подходит принципиально иначе.
  • Иногда «другой путь» оказывается успешнее: самолёты летают не как птицы, по придуманному людьми принципу — и летают хорошо. Но с дизайном органов такой обходной путь пока не срабатывает.

Организационное

  • Завтра планируется итоговый стрим по трём Нобелевским премиям этого года — кратко о том, за что их дали и почему это важно.
  • Вышло новое видео о теории Дарвина и попытках её запретить (не только в России). Там разбирается, какие научные данные позволяют с некоторой вероятностью предсказать, кто склонен отвергать рациональные объяснения в пользу сверхъестественных.
  • Просьбы к аудитории: лайки, подписка, комментарии (это важно для алгоритмов), а также поддержка через спонсорство на YouTube, Patreon и Boosty.
  • Анонсы публикуются в Telegram-канале «Безвольные каменщики» и в Facebook, где страница, судя по всему, находится в теневом бане по неизвестным причинам — «мы же не понимаем, что там у нейросетей в электронных мозгах».