Google DeepMind разработала систему невидимой маркировки для синтетически спроектированных белков. SynthID Bio встраивает подпись прямо в аминокислотную последовательность или трёхмерную структуру молекулы — так, что отпечаток сохраняется даже после превращения цифрового проекта в физический объект.
Метка работает не как ярлык на внешней поверхности. Совместимая модель незаметно выбирает определённые аминокислоты во время проектирования белка, создавая статистический сигнал, который распознаёт специальный детектор. Найденная метка подтверждает происхождение из поддерживаемой системы. Её отсутствие ничего не говорит — это не доказывает, что белок природный или создан другой программой.
Для трёхмерных структур Google DeepMind дообучила часть диффузионной сети AlphaFold 3. Теперь координаты атомов несут встроенную подпись происхождения.
Главный вызов — подпись не должна испортить сам белок. Команда протестировала методику на трёх целевых молекулах: белке, связывающемся с VEGF-A, доменом RBD коронавирусного шипа и PD-L1. Лабораторные результаты показали, что маркированные белки сохраняют исходные свойства связывания, процент успешных вариантов и разнообразие последовательностей.
Практическое применение связано с проверкой заказов на синтез ДНК. Компании, занимающиеся синтезом, сравнивают последовательности с базами опасных организмов и токсинов. Но генеративные модели создают молекулы, которые могут сильно отличаться от известных образцов. Старая логика «неизвестная последовательность — скорее всего, природная» перестаёт работать.
Метка даст синтез-сервисам дополнительный сигнал. Если последовательность пришла из доверенной модели с встроенными ограничениями, система подтвердит происхождение и позволит сосредоточить ручной анализ на более подозрительных заказах. Подпись не доказывает безопасность молекулы — это дополнительный уровень проверки происхождения.
Похожий механизм нужен научным базам Protein Data Bank, UniProt и GenBank. Ошибочно помеченная синтетическая структура может попасть в последующие исследования как природная и повлиять на выводы других команд.
Работу опубликовали в Nature 30 сентября. Авторы называют SynthID Bio доказательством концепции, а не готовым стандартом. Метку ещё нужно лучше защитить от намеренного удаления и согласовать способы проверки между разработчиками, лабораториями и компаниями-синтезаторами.
Разработка появляется в момент, когда ИИ уже выходит за пределы предсказания формы существующих молекул. В августе учёные показали алгоритм, который ищет новые белковые последовательности, сознательно избегая решений, найденных эволюцией. Другие команды используют генеративные системы для крупных конструкций — летом ИИ помог создать белковые оболочки, которые самостоятельно собираются в структуры размером до 220 нанометров и могут служить контейнерами для лекарств или компонентов вакцин.
Объём цифровой биологии растёт параллельно. База ESM Atlas уже содержит предсказанные структуры более 1,1 млрд белков. Чем больше таких данных создают алгоритмы, тем острее встаёт вопрос, который раньше почти не задавали: перед учёным результат естественной эволюции или конструкция вычислительной модели?
