Исследование представляет новый метод интерпретации протеиновых языковых моделей (PLM) для идентификации функционально значимых регионов белков. Авторы использовали модель ESM-2 (Evolutionary Scale Modelling 2) для выявления сайтов с высоким вниманием (HA sites) — специфических аминокислотных остатков, которым модель assigns наибольшее внимание на ранних этапах кодирования. Применено unsupervised clustering для категоризации HA сайтов на четыре типа: «структурное ядро», «структурные патогенные», «ядерные патогенные» и «низкая достоверность». Методология включала интеграцию с предсказаниями патогенности AlphaMissense и данными пан-ракового анализа всего генома (PCAWG) для валидации. Результаты показали, что HA сайты эффективно предсказывают белковые регионы с высоким патогенным риском и могут идентифицировать кандидатные сайты связывания. В нескольких примерах онкологических белков метод обнаружил ранее неизвестные регионы с высокой вероятностью взаимодействия, что имеет потенциальную терапевтическую ценность. Работа демонстрирует биологическую интерпретируемость представлений PLM и предлагает практический инструмент для приоритизации функционально релевантных белковых остатков в биомедицинских исследованиях и разработке таргетных терапий.