Исследование демонстрирует применение белковых языковых моделей (pLM) — разновидности ИИ для анализа белковых последовательностей — к метагеномным данным. Авторы показывают, что pLM могут раскрыть функциональный потенциал миллиардов белков из некультивируемых микроорганизмов, когда обучающие данные правильно курированы. Разработана метрика RED (Residue Embedding Diversity) для оценки качества белков, которая работает на порядки дешевле традиционных методов на основе правдоподобия. Обнаружен фундаментальный компромисс между эволюционной калибровкой моделей и структурным моделированием: состав обучающих данных является ключевым фактором, определяющим поведение pLM. Исследователи успешно извлекли разнообразные кандидаты в ферменты из миллиардов метагеномных последовательностей и подтвердили их экспрессию in vivo. Работа имеет значение для открытия новых терапевтических ферментов и понимания микробиома, хотя прямое клиническое применение не демонстрируется.