Предложена гибридная модель HybridCATNet, объединяющая CNN и Vision Transformer для высокоточной диагностики пневмонии. Система использует многоканальное слияние данных и байесовский дропаут для оценки неопределенности, демонстрируя точность до 96.93% и высокую интерпретируемость через Grad-CAM и SHAP.
В статье исследуется проблема обобщения моделей предсказания структуры белок-лиганд, таких как Boltz-1, которые часто не справляются с предсказанием альтернативных конформационных состояний белка или новых сайтов связывания. Авторы демонстрируют, что это ограничение связано не с архитектурой модели, а с смещением в обучающих данных, и предлагают решение через целевую дообучение (targeted finetuning). На примере фермента хеликазы Вернера (WRN) с использованием 10 ранее неизвестных рентгеноструктурных данных, модель была дообучена для распознавания аллостерического сайта связывания и крупного конформационного изменения, блокирующего активность фермента, при этом сохранив точность предсказания для АТФ-связанного состояния. Дообученная модель успешно обобщается на различные химические серии лигандов и переносит логику конформационных изменений на другие хеликазы семейства RecQ в зависимости от последовательности сайта связывания. Этот подход создает основу для адаптации фундаментальных моделей ИИ по мере появления новых структурных и механистических данных, позволяя сетям кофолдинга улавливать индуцированные лигандами переключатели конформаций, которые отсутствуют в исходных обучающих наборах, но критически важны для биологической регуляции и разработки лекарств. Исследование подчеркивает потенциал дообучения больших языковых и структурных моделей для решения специфических задач химической биологии и поиска новых терапевтических мишеней.
В статье представлен метод HANAMI (Heterogeneous grAph coNtrastive leArning for drug-gene-disease Motif predIction) — глубокая графовая нейросетевая модель для предсказания взаимосвязей между лекарствами, генами и заболеваниями. Метод использует контрастивное обучение на гетерогенных графах для интеграции разнородных биомедицинских данных: химических структур, геномных последовательностей и клинических фенотипов. Архитектура включает кодирование топологии с учетом связей и агрегацию с учетом структуры, что позволяет улавливать сложные высшие топологические сигнатуры биологических интерактомов. Систематическая оценка на бенчмарках показала улучшение до 6% по сравнению с существующими методами SOTA в предсказании мотивов. Особое значение имеет способность модели к индуктивному обобщению: в условиях zero-shot (для ранее не встречавшихся сущностей) преимущество над аналогами составляет около 18%. Модель эффективно ранжирует пары лекарство-болезнь, которые впоследствии исследуются в клинических испытаниях II и III фаз, выявляя кандидаты в гены с правдоподобными механизмами действия. HANAMI предлагает масштабируемую вычислительную основу для интерпретации сложных биомедицинских взаимодействий, ускоряя репозиционирование лекарств и разработку новых терапий.
В статье представлен MetExPred — новая многовидовая предиктивная модель, разработанная для решения задачи прогнозирования метаболизма и экскреции (ME) лекарственных препаратов в рамках ADMET-анализа. Модель объединяет последовательные и графовые представления молекул, а также опционально использует представления белков ESM-2, если доступны экспериментально аннотированные мишени. Архитектура использует стратегию маскирования, зависящую от наличия белковой информации, и механизм многовидового внимания для адаптивной интеграции различных типов данных. Исследование охватывает 17 классификационных и 2 регрессионных конечных точки, обеспечивая комплексное покрытие процесса ME. Модель продемонстрировала высокие результаты: средние значения AUROC, AUPRC и F1 составили 0.844, 0.734 и 0.697 соответственно. Для регрессионных задач прогнозирования клиренса и периода полувыведения RMSE составил 0.686 и 0.668. Сравнение с базовыми моделями показало, что MetExPred имеет наилучшие средние показатели, а аблиционные исследования подтвердили комплементарность молекулярных, графовых и белковых данных. Разработанный фреймворк позволяет проводить виртуальный скрининг и фармакокинетическую оценку на ранних этапах оптимизации лидов.
В статье представлен метод Pop-Corn, основанный на глубоком обучении, который напрямую предсказывает, как генетические возмущения изменяют состав клеточных популяций, минуя промежуточный этап реконструкции экспрессии генов. Традиционные подходы часто опираются на предсказание изменений средней экспрессии генов с последующим выводом клеточных типов, что, как выяснили авторы, приводит к низкой точности прогнозирования композиционных сдвигов. Метод Pop-Corn был протестирован на бенчмарке с Т-клетками, где он превзошел существующие конвейеры предсказания экспрессии по точности прогнозирования состава состояний клеток и лучше сохранил разнообразие наблюдаемых клеточных состояний. Расширение метода на пространственные данные позволило предсказывать изменения пропорций клеточных типов в локальных микроокружениях тканей, используя механизмы внимания для генерации гипотез о контекстно-зависимых клеточных взаимодействиях. Авторы демонстрируют, что ретроспективные виртуальные скрининги с использованием Pop-Corn могут эффективно приоритизировать генетические возмущения для последующего экспериментального подтверждения. Это решение решает ключевую проблему масштабирования пуловых скринингов, таких как Perturb-seq, где экспериментально проверяется лишь малая часть возможных возмущений. Представленный подход открывает новые возможности для высокоточного моделирования биологических систем и ускорения открытия терапевтических мишеней за счет точного прогнозирования фенотипических эффектов на уровне отдельных клеток.
В статье представлен метод DualTopoDDI — интерпретируемая модель глубокого обучения на основе двойных топологических графов для предсказания взаимодействий между лекарствами (DDI). Традиционные методы часто не способны предоставить механизмы таких взаимодействий, что критично для безопасности пациентов. Авторы применили модель для прогнозирования 9,2 миллиардов потенциальных взаимодействий среди одобренных препаратов, достигнув 97,99% точности для высоконадежных предсказаний. Модель обеспечивает интерпретируемость на молекулярном уровне, выявляя ключевые субструктуры, ответственные за действие препаратов, как с атомарной, так и с связевой точек зрения. Особое внимание уделено объяснению механизмов токсичности, включая успешную расшифровку кардиотоксичности при комбинации препаратов для лечения COVID-19. Оценка на 11 бенчмарк-наборах данных показала, что DualTopoDDI превосходит существующие аналоги по производительности, обобщающей способности и интерпретируемости. Этот инструмент предоставляет критически важные инсайты для обеспечения безопасности лекарств и их дизайна.
В статье представлено систематическое исследование влияния предобученных языковых моделей белков (PLM) на задачу прогнозирования аффинности связывания лекарств с белками-мишенями (DTA). Авторы интегрировали четыре семейства PLM в архитектуру PLM-GraphDTA, каждая из которых основана на различных архитектурах и оптимизирована для разных задач: предсказание структуры, предсказание функций и маскирование последовательностей. Для сравнения также оценивалась модификация классического метода сверток — DeepGraphDTA, улучшающая представление белков. Модели тестировались на двух бенчмарк-датасетах (Davis и KIBA) с использованием индекса конкордантности (CI) и среднеквадратичной ошибки (MSE). Дополнительно оценивалась способность моделей к обобщению на новых белках с помощью cold-start разбиений и анализировался вклад каждого белка в общий CI. Результаты показали, что простые архитектурные модификации традиционных сверточных методов могут сократить разрыв с крупными предобученными PLM, что имеет практическое значение для ускорения открытия лекарств и снижения затрат на разработку.
Обзор систематизирует исследования по применению глубокого обучения в диагностике лейкемии, охватывая анализ изображений крови и костного мозга, геномные данные, проточную цитометрию и мультимодальные подходы. Критически оцениваются проблемы обобщаемости моделей, интерпретируемости и клинической применимости, предлагаются направления для будущих исследований включая fusion-подходы и валидацию на внешних датасетах.
Исследователи представили HDOCK-Multimer (HDM) — новый фреймворк на основе глубокого обучения для предсказания структуры крупных белковых комплексов, который объединяет методы ab initio докинга и комбинаторной сборки. В отличие от существующих подходов вроде AlphaFold и RosettaFold, которые сталкиваются с трудностями при работе с крупными многоцепочечными белками, HDM снижает зависимость от точности предсказания отдельных компонентов за счёт интеграции докинга с стратегией сборки. Метод был протестирован на трёх бенчмарках: 35 крупных гетеромерных комплексов, 172 крупных белковых комплекса и 7 мишеней CASP15, где продемонстрировал существенное превосходство над современными методами включая MoLPC, CombFold, AlphaFold-Multimer и AlphaFold3. Важной особенностью HDM является способность предсказывать стехиометрию комплексов без необходимости ввода этой информации заранее. Инструмент особенно ценен для изучения крупных белковых комплексов и молекулярных машин, что имеет прямое значение для разработки лекарств и понимания механизмов заболеваний. Пакет HDM доступен бесплатно на GitHub по адресу https://github.com/huang-laboratory/HDOCK-Multimer.
Исследователи разработали MDA-Net — фреймворк доменной генерализации для обнаружения рака головы и шеи по КТ-снимкам, работающий в условиях различий между больницами. Модель улучшила AUC с 0.51 до 0.59 и точность с 48% до 60% на мультицентровом датасете из 1081 случая, не требуя адаптации при инференсе.
Исследователи разработали CLEAR-Lactyl — курированный эталонный набор данных человеческого лактилирования лизина, включающий 16 604 положительных сайта модификации. На его основе создан AttentionKla — фреймворк глубокого обучения, использующий предобученную языковую модель белков, дообученную с помощью технологии LoRA (Low-Rank Adaptation). Метод значительно превосходит существующие инструменты предсказания сайтов лактилирования, что подтверждено комплексными абляционными исследованиями. Практическая полезность подхода экспериментально валидирована в клеточных анализах: система способна предсказывать новые сайты лактилирования и осуществлять направленную модуляцию уровней модификации через последовательность. Лактилирование лизина — динамическая посттрансляционная модификация, влияющая на функцию белков и связанная с разнообразными физиологическими и патологическими процессами, включая воспалительные заболевания и онкологию. Результаты предоставляют исследователям мощную платформу для изучения регуляторного ландшафта лактилирования и генерирования проверяемых гипотез о связанных механизмах. Фреймворк является расширяемым и может быть адаптирован для точной модуляции других посттрансляционных модификаций белков.
В исследовании представлена инновационная мультимодальная модель (vision-language model), которая имитирует когнитивный процесс врача-радиолога при анализе медицинских изображений. Ключевой особенностью разработки является использование данных о движении глаз (eye-tracking) и вербальных рассуждениях экспертов в процессе обучения. Это позволяет модели не просто классифицировать патологии, но и фокусироваться на критически важных анатомических зонах, имитируя человеческое внимание. Методология обучения объединяет визуальные признаки рентгенологических снимков с текстовыми объяснениями, что повышает точность интерпретации сложных случаев. Результаты демонстрируют значительное превосходство модели над стандартными архитектурами в задачах описания изображений и постановки диагнозов. Данная технология открывает путь к созданию более прозрачных и объяснимых систем поддержки принятия врачебных решений (CDSS) в радиологии. Практическая значимость работы заключается в сокращении времени на анализ снимков и снижении вероятности пропуска патологий из-за человеческого фактора.
Исследование представляет DEPICT (Drug rEsponse Prediction in transCriptomics with Transformers) — глубокую нейросетевую модель на основе трансформеров, которая предсказывает транскрипционные ответы клеток на лекарственные препараты в зависимости от базового экспрессионного профиля генов и параметров воздействия. Модель обучена на датасете LINCS L1000 и демонстрирует способность обобщать знания на невиданные ранее препараты и типы клеток. В наиболее сложной задаче предсказания для неизвестных типов клеток DEPICT превзошла все базовые стратегии и два недавних глубоких обучающих модели, улучшив точность предсказания дифференциальной экспрессии и снизив ошибку предсказания возмущённой экспрессии на 30.3% и 36.8% соответственно. В случае не-мелкоклеточного рака лёгких (NSCLC) виртуальный скрининг с использованием DEPICT выявил соединения, способные обратить патологические транскрипционные сигнатуры заболевания, при этом 13 из 20 приоритетных соединений ранее проходили клинические испытания или были валидированы в исследованиях NSCLC. Модель также позволяет предсказывать синергию препаратов и проводить механизмы исследования даже при отсутствии экспериментально сопоставимых профилей. Результаты демонстрируют, что точное условное сопоставление in silico профилирования возмущений может масштабировать генерацию гипотез для репозиционирования лекарств и открытия комбинаций препаратов.