Обзор посвящен интеграции машинного обучения и механистических моделей для создания цифровых двойников пациентов. В работе предлагается гибридный подход для персонализации лечения и мониторинга состояния пожилых онкологических больных, подкрепленный кейсом с использованием марковских процессов принятия решений.
В исследовании представлен grapHiC — инновационный метод на базе машинного обучения, предназначенный для фазирования гаплотипов при сборке генома de novo без использования родительских данных. Авторы переформулировали задачу фазирования как проблему кластеризации узлов с перекрывающимися кластерами на аугментированных графах унитигов, где узлы представляют фрагменты ДНК, а ребра кодируют перекрытия последовательностей или данные Hi-C близости. В основе метода лежит архитектура Graph Transformer и фреймворк контрастивного обучения с кастомной целевой функцией. grapHiC является первым подходом, способным проводить фазирование необработанных графов унитигов напрямую без предварительного упрощения и без привязки к референсному геному. Эксперименты на масштабе человеческого генома показали, что при интеграции с ассемблером DipGNNome метод обеспечивает непрерывность и качество фазирования, сопоставимое с современными передовыми технологиями (state-of-the-art). Данная разработка значительно упрощает процесс высококачественной сборки сложных геномов, автоматизируя разделение отцовских, материнских и гомозиготных участков.
В исследовании представлен Diff-Switch — инновационный фреймворк для проектирования белков-переключателей (protein switches), способных менять свою структуру в ответ на биохимические стимулы. В отличие от существующих методов, оптимизированных под одну стабильную структуру, Diff-Switch использует предобученные диффузионные модели для генерации ансамблей разнообразных структурных состояний. Методология сочетает контроль локальной геометрии доменов с механизмом reward-tilting и смещением в пространстве коллективных переменных (вдохновленным метадинамикой), что позволяет избегать повторения одних и тех же конформаций. Тестирование на наборе из 20 различных белков показало, что использование сгенерированных ансамблей значительно повышает вероятность успешного нахождения последовательностей, совместимых с механизмом переключения, по сравнению с базовыми методами сэмплирования. Разработанный подход позволяет автоматизировать сложный процесс дизайна многостабильных белков, который ранее требовал глубоких экспертных знаний. Полученные результаты имеют критическое значение для биоинженерии и разработки новых терапевтических белков и сенсоров.
В статье представлен CSOA (Cell Set Overlap Analysis) — инновационный метод анализа обогащения наборов генов (GSEA) для данных секвенирования единичных клеток. Основная проблема существующих подходов заключается в генерации неоднозначных оценок, которые не позволяют четко отличить клетки с биологическим сигналом от фонового шума. Авторы предложили использовать взаимосвязи генных пар, количественно оценивая парные перекрытия между наборами высокоэкспрессируемых клеток, построенными для каждого сигнального гена. В ходе исследования CSOA был протестирован против 16 существующих методов, представляющих пять методологических классов, включая прямое и ранговое скорирование, а также анализ избыточности. Использование новых метрик, таких как покрытие оценки (score coverage) и выравнивание силуэта ранга (silhouette rank alignment), подтвердило превосходство CSOA в точности аннотации типов клеток и биологических процессов. Метод показал лучшие результаты в определении границ классов во всех протестированных наборах данных и превзошел большинство конкурентов по вычислительной эффективности. CSOA является высокоэффективным инструментом для точного выявления клеток, обогащенных специфическими биологическими сигналами.
Исследование посвящено анализу механизмов работы геномных фундаментальных моделей (Genomic Foundation Models) и выявлению того, какие именно слои нейросети наиболее важны для классификации генетических вариантов. Авторы исследуют разрыв между «репрезентативными» слоями (где пиковая точность одного признака) и «нагрузочными» слоями (на которые опирается итоговый классификатор). В ходе экспериментов на базе 8 008 вариантов из базы ClinVar использовались модели NT-v2 500M (MLM) и Evo 2 7B (CLM). Результаты показали, что эти слои не совпадают: в MLM-моделях нагрузочные слои находятся в середине-начале сети, а в гибридных CLM-моделях — глубоко в конце. Практическая значимость работы заключается в том, что использование стандартного последнего слоя (last-layer pooling) приводит к потере важного сигнала; например, в модели NT-v2 использование 1-мерного скаляра из среднего слоя повышает AUROC на 0,049 по сравнению с классическим 1024-мерным методом. Это дает четкое руководство для оптимизации архитектур при анализе генетических данных.
Исследование посвящено изучению биофизических характеристик интерфейсов белок-белковых взаимодействий (PPI) в трансмембранных белках, которые играют ключевую роль в передаче сигналов и транспорте веществ. Авторы использовали интерактом белков-переносчиков человека (SLC) и применили AlphaFold v3.0 для предсказания структур 2 055 экспериментально подтвержденных взаимодействий. В ходе работы проводилось молекулярное динамическое моделирование, а каждый интерфейс был описан с помощью 63 физико-химических, структурных и энергетических признаков. Результаты показали, что аминокислотный состав и вторичная структура являются определяющими факторами для отличия растворимых интерфейсов от полностью встроенных в мембрану. Было установлено, что мембранно-встроенные интерфейсы характеризуются повышенной долей гидрофобных остатков и α-спиралей при значительном дефиците заряженных остатков. Исследование выявило, что характеристики интерфейса варьируются в зависимости от количества трансмембранных сегментов, что создает надежную основу для будущего дизайна и изучения взаимодействий мембранных белков с помощью машинного обучения.
Представлен GeneAutomate — специализированный веб-инструмент для сравнительного анализа функциональной геномики, предназначенный для одновременной обработки двух списков генов (например, из разных групп лечения или тканей). В отличие от существующих сервисов вроде DAVID или Enrichr, работающих с одиночными списками, GeneAutomate реализует анализ обогащения (ORA) по базам Gene Ontology и Reactome, а также GSEA при наличии ранжированных данных. Уникальность архитектуры заключается в использовании предварительно скомпилированной офлайн-базы данных объемом 32 МБ, где все идентификаторы (Ensembl, Entrez, символы) сопоставлены с единым целочисленным индексом, что исключает задержки при запросах к серверам. Платформа предлагает 13 интерактивных видов визуализации на базе D3.js и Cytoscape.js, включая тепловые карты RRHO, «радарные» диаграммы функциональных отпечатков GO-slim и диаграммы перекрестных связей (chord diagrams). Инструмент позволяет извлекать подграфы белок-белковых взаимодействий (PPI) из базы BioGRID, обеспечивая глубокую интеграцию данных без необходимости локальной установки ПО или использования R/Bioconductor. На текущем этапе разработка ограничена только видами Homo sapiens и анализом не более трех списков одновременно.
Исследование посвящено разработке модели на основе случайного леса (Random Forest) для выявления пациентов, склонных к обострению стенокардии при высоких температурах. Модель показала высокую точность в прогнозировании рисков, используя 14 предикторов, включая биомаркеры воспаления и метаболизма липидов.
Представлен BaiZe — инновационный фреймворк на базе машинного обучения, предназначенный для предсказания изменений транскриптома клетки после различных воздействий (генетических, химических, временных). В отличие от существующих моделей, BaiZe использует мультиview-подход, моделируя ответы как контекстно-зависимые переходы между состояниями клеток. Система способна предсказывать результаты для ранее не встречавшихся комбинаций генов, новых химических структур и дозировок, а также обеспечивает перенос знаний (few-shot transfer) между видами, например, от человека к мыши. Интеграция данных ATAC-seq позволяет модели связывать изменения хроматина с конкретными генами и путями, повышая точность прогнозов. Для интерпретации результатов разработан BaiZe-Agent, который систематизирует гены отклика, пути и фенотипические проекции в структурированные записи. Данная технология имеет критическое значение для биомедицинских исследований, позволяя приоритизировать гипотезы и планировать экспериментальные вмешательства с высокой точностью.
В исследовании, опубликованном в журнале npj Digital Medicine, представлен инновационный метод контрастного моделирования мозга для классификации подтипов депрессивных расстройств. Авторы применили передовые алгоритмы машинного обучения для анализа нейровизуализационных данных, что позволило идентифицировать специфические биологические подгруппы пациентов. Исследование демонстрирует, что выявленные подтипы имеют фундаментально разные траектории клинического прогрессирования и по-разному реагируют на стандартную терапию. Использование ИИ-моделей позволило достичь высокой точности в дифференциации состояний, которые ранее считались однородными. Результаты подчеркивают потенциал персонализированной психиатрии, где нейровизуализационные биомаркеры, обработанные ИИ, определяют наиболее эффективную стратегию лечения. Это открывает путь к внедрению прецизионных методов диагностики в клиническую практику для снижения риска неэффективного лечения депрессии.
В исследовании представлен новый байесовский фреймворк FABOr (Factor Analysis of Binary and Ordinal data), предназначенный для матричного разложения данных, которые не являются непрерывными. В отличие от традиционных методов, ориентированных на количественные показатели, FABOr эффективно работает с бинарными и порядковыми фенотипами, часто встречающимися в клинических скринингах и опросниках. Авторы разработали расширение метода для обработки данных с механизмом пропусков, не являющимся случайным (MNAR), что критически важно для медицинских исследований. Эксперименты на симулированных данных показали, что FABOr превосходит существующие бенчмарки при работе с порядковыми признаками. При применении алгоритма к реальному набору данных Simons Foundation SPARK, касающемуся расстройств аутистического спектра (ASD), точность импутации (восстановления данных) выросла на 5% для бинарных и на впечатляющие 23% для порядковых данных. Данная разработка имеет высокую практическую значимость для анализа сложных генетических и поведенческих профилей в психиатрии и неврологии.
Исследователи представили PepCL (Peptide-MHC Continual Learning) — инновационный фреймворк непрерывного обучения, предназначенный для динамического обновления прогностических моделей взаимодействия пептидов с главным комплексом гистосовместимости (MHC) I класса. Проблема заключается в том, что традиционные модели, обученные на данных масс-спектрометрии (MS), не учитывают новые данные из других экспериментальных методов из-за технических и биологических смещений. В рамках работы также разработана модель MHCPrime — новое современное решение для пан-аллельного предсказания пептид-MHC связывания. Использование PepCL позволяет модели MHCPrime эффективно усваивать специфическую информацию из новых тестов, предотвращая «катастрофическое забывание» знаний, полученных из предыдущих наборов данных MS. Тестирование в контекстах инфекционных заболеваний и онкологии показало значительное улучшение точности предсказаний и их переносимость между различными аллелями. Это делает фреймворк критически важным инструментом для разработки персонализированных вакцин и иммунотерапии в клинических условиях по мере накопления новых иммунопептидомных данных.
В статье представлен GCM (Genetic Clustering by Metric) — новый инструмент с открытым исходным кодом на языке Python, предназначенный для более точного выявления генных модулей в анализах коэкспрессии. В отличие от стандартных жадных алгоритмов, GCM рассматривает обнаружение модулей как задачу вывода максимального правдоподобия, используя блочно-диагональную однофакторную гауссовскую модель. Для глобальной оптимизации применяется меметический генетический алгоритм, сочетающий популяционный поиск с локальным уточнением, что позволяет перераспределять гены более эффективно, чем иерархическая кластеризация или k-means. Исследования на наборе данных Iris и тестах с шумом подтвердили, что GCM демонстрирует наименьшую дисперсию и превосходит существующие методы. В прикладном биомедицинском тесте на данных РНК-секвенирования при раке молочной железы алгоритм успешно выявил когерентные модули, которые эффективно предсказывают статус «опухоль против нормы». Инструмент отличается легкостью внедрения, так как требует только библиотек NumPy и SciPy, и поддерживает многокритериальную оптимизацию через гибкий интерфейс метрик.
Исследователи представили ProtSyntax — специализированную белковую языковую модель (pLLM), ориентированную на изучение посттрансляционных модификаций (PTM). В отличие от существующих методов, моделирующих сайты модификации независимо, ProtSyntax учитывает взаимосвязь между химией остатков, контекстом последовательности и трехмерной микросредой. Модель была обучена на массиве из 4,25 миллиона примеров, охватывающих 40 классов PTM, с использованием архитектуры разреженного смеси экспертов (sparse mixture-of-experts) и механизмов геометрически-управляемого внимания (geometry-gated attention). Результаты тестирования на 40 бенчмарках показали значительное превосходство над базовыми моделями: средние показатели MCC и AP выросли на 12,7% и 10,7% соответственно. ProtSyntax успешно идентифицирует перекрестные помехи (crosstalk) между модификациями, связывает изменения PTM с кинетикой ферментов и выявляет нарушения модификаций, связанные с заболеваниями. Данная разработка предоставляет интерпретируемую платформу для глубокого анализа регуляции протеома, что критически важно для разработки таргетной терапии.
В статье представлен scRepresenter — новый инструмент с открытым исходным кодом, предназначенный для решения проблем разреженности данных и гетерогенности при анализе scRNA-seq. Авторы разработали комплексный рабочий процесс, который позволяет вычислять, интегрировать и валидировать клеточные эмбеддинги, полученные как с помощью масштабных моделей-оснований (foundation models), так и через методы, опирающиеся на биологические знания. Инструментарий включает в себя интерфейс командной строки для автоматизации вычислений и интерактивное приложение Shiny для визуального сравнения различных типов репрезентаций. scRepresenter поддерживает четыре ключевые категории эмбеддингов: экспрессионные, основанные на знаниях, производные от моделей-оснований и гибридные модели. Система принимает на вход матрицу подсчета экспрессии генов по клеткам и выдает интегрированный объект, готовый к глубокому анализу. Данная разработка имеет критическое значение для изучения сложных заболеваний, таких как боковой амиотрофический склероз (БАС), позволяя исследователям более точно идентифицировать переходные состояния клеток.
Исследователи из Первого МГМУ имени И.М. Сеченова приступили к разработке инновационной интеллектуальной системы для персонализированного мониторинга гликемии у пациентов с сахарным диабетом. Ключевой особенностью разработки является интеграция алгоритмов машинного обучения, которые учитывают не только текущие показатели глюкозы, но и динамику гормональных циклов организма. Методология исследования базируется на анализе больших данных (Big Data), поступающих с систем непрерывного мониторинга глюкозы (CGM), что позволяет прогнозировать резкие скачки сахара до их фактического возникновения. Ожидается, что внедрение такой системы позволит снизить риск развития тяжелых осложнений диабета за счет более точной превентивной коррекции доз инсулина. Технология ориентирована на создание адаптивных моделей, способных подстраиваться под индивидуальные биоритмы каждого пациента, что значительно повышает точность прогнозирования по сравнению со стандартными методами. Данная разработка имеет высокую практическую значимость для эндокринологии и цифровой медицины в целом.
Российская компания Nord Clan официально зарегистрировала семь специализированных продуктов своей платформы машинного зрения ML Sense в Едином реестре российского программного обеспечения. Данная инициатива направлена на импортозамещение и развитие отечественных технологий компьютерного зрения в различных индустриальных секторах. Платформа ML Sense представляет собой комплексное решение для автоматизации процессов распознавания и анализа визуальных данных с использованием алгоритмов машинного обучения. Включение продуктов в реестр позволяет использовать данные решения в государственных структурах и на критически важных объектах инфраструктуры, где требуется соблюдение требований по безопасности и локализации ПО. Технологическая база платформы ориентирована на высокую точность детекции объектов и стабильную работу в реальном времени, что критически важно для систем мониторинга. Несмотря на то, что статья фокусируется на юридическом аспекте регистрации, внедрение данных ML-решений открывает новые возможности для цифровизации промышленного контроля и обеспечения безопасности.
В исследовании представлен новый биоинформатический инструмент multiScaleAC, предназначенный для анализа пространственной транскриптомики и изучения взаимодействия клеток в опухолевом микроокружении. Авторы решают проблему предвзятости при выборе фиксированного радиуса взаимодействия, предлагая использовать расширенный индекс Морана с применением гауссова ядра и варьируемой шириной полосы пропускания (h). Методология позволяет анализировать взаимодействия на различных пространственных масштабах, используя функциональный анализ данных. В ходе симуляций метод продемонстрировал высокую статистическую мощность: показатель 1.00 при полосах пропускания более 5 для истинных взаимодействий. При тестировании на 8 образцах ткани толстой кишки (Visium) инструмент выявил профили лиганд-рецепторных взаимодействий с точностью 73.7%–87.2% по сравнению с методом spatialDM. Применение метода к данным по почечно-клеточной карциноме показало, что показатели функционального компонента 1 коррелируют с воздействием иммунотерапии: в стромальных тканях, подвергшихся лечению, наблюдался значительно более высокий уровень взаимодействий COL4A1-ITGAV. Это делает multiScaleAC важным инструментом для более точного понимания архитектуры тканей и ответа на терапию.
Исследование представляет новый интерпретируемый ансамблевый фреймворк на базе машинного обучения, предназначенный для прогнозирования жидкостно-жидкостного фазового разделения (LLPS) белков. В отличие от традиционных методов, опирающихся на структурную стабильность, данная модель использует эмбеддинги языковых моделей белков (protein language models) и предсказанные структуры для анализа внутренне неупорядоченных регионов (IDR). Разработанный двухэтапный классификатор эффективно разделяет белки на саморазделяющиеся и зависящие от партнеров, демонстрируя превосходство над существующими методами на независимых бенчмарках, особенно в категории партнерно-зависимых белков. Авторы применили модель к базам данных болезнетворных вариантов, обнаружив, что патогенные мутации значительно обогащены в регионах, ответственных за фазовое разделение. Результаты показывают, что такие мутации часто нарушают показатели склонности к LLPS, что указывает на нарушение регуляции фазового разделения как на ключевой механизм развития множества заболеваний. Данный инструмент позволяет не только точно идентифицировать фазоразделяющие белки, но и количественно оценивать влияние конкретных мутаций на биофизические свойства протеома.
В исследовании представлен новый метод интерпретируемости GDTR (Genomic Deep-Thinking Ratio), предназначенный для анализа геномных фундаментальных моделей без необходимости дополнительного обучения. Авторы используют подход через анализ остаточных потоков (residual-stream lens), чтобы определить «глубину стабилизации» каждого нуклеотидного токена — слой, на котором его представление становится стабильным относительно финального состояния модели. При тестировании на модели Evo 2 7B было обнаружено, что сайты сплайс-доноров и акцепторов стабилизируются примерно на два слоя раньше, чем интронные контексты. Исследование также показало, что нарушение канонического мотива GT в сайтах сплайсинга увеличивает глубину стабилизации, в то время как перемешивание окружающего контекста заставляет мотив стабилизироваться раньше. Кроме того, метод GDTR позволил выявить различия в глубине стабилизации для вариантов ClinVar, где синонимичные замены демонстрируют наибольшую глубину. Данный инструмент предоставляет новый вектор интерпретируемости для геномных моделей, дополняя существующие методы предсказания вариантов и оценки их последствий.