Обзорный анализ применения методов машинного и глубокого обучения (CNN, RNN, GAN и др.) для диагностики болезни Альцгеймера на основе нейровизуализационных данных. Особое внимание уделяется мультимодальным подходам, объединяющим МРТ и ПЭТ, а также методам предобработки и аугментации данных для повышения точности классификации.
Исследователи разработали инновационную модель глубокого обучения под названием PLASMA (Predicting Lung Adenocarcinoma recurrence via Selective Multimodal Attention), предназначенную для прогнозирования раннего рецидива аденокарциномы легкого (LUAD). Модель использует мультимодальный подход, интегрируя клинические данные, профили экспрессии мРНК и данные о мутациях пациентов с первичными стадиями I-III. Обучение проводилось на масштабном наборе данных The Cancer Genome Atlas (TCGA), что позволило достичь высокой точности. В ходе тестирования PLASMA продемонстрировала превосходство над традиционными методами машинного обучения, показав показатель AUROC 85,0% на тестовой выборке TCGA и 76,5% на внешней валидационной выборке TRACERx Lung. Данная разработка имеет высокую клиническую значимость, так как позволяет проводить эффективную стратификацию рисков и более точно прогнозировать выживаемость пациентов после резекции опухоли. Использование мультимодальных нейросетей открывает новые возможности для персонализированной онкологии в диагностике рецидивов.
В статье представлен MoCoO — инновационный модульный фреймворк, предназначенный для анализа данных секвенирования РНК единичных клеток (scRNA-seq). Архитектура объединяет вариационный автоэнкодер (VAE), нейронные обыкновенные дифференциальные уравнения (Neural ODE) и метод Momentum Contrast (MoCo), дополненные этапом уточнения через Flow Matching (FM). Исследование, проведенное на 20 наборах данных scRNA-seq, показало, что синергия ODE и MoCo позволяет эффективно моделировать как дискретную идентичность типов клеток, так и непрерывные траектории их развития. Результаты тестов подтверждают превосходство модели: комбинация VAE+ODE+MoCo+FM достигла лучших показателей по метрикам ASW (0.257) и DAV (1.359), а полная версия MoCoO показала лучшие результаты по DRE (0.678), DREX (0.660) и CAL. Использование Flow Matching позволило улучшить качество эмбеддингов в 92% случаев (по метрике DREX). Разработанный метод успешно применяется для аннотации клеток, количественной оценки неопределенности и обнаружения ветвлений в процессах дифференцировки, обеспечивая высокую корреляцию псевдовремени с каноническими маркерными генами.
В исследовании представлен Parallel-REM — высокопроизводительный Python-пайплайн, предназначенный для ускорения построения сетей микробных взаимодействий. Авторы решают проблему вычислительной сложности существующих методов (например, реализаций в R), которые не справляются с высокоразмерными метагеномными данными из-за однопоточной обработки. Методология включает использование стратегии параллелизации «Master-Worker» с применением библиотек joblib и statsmodels, а также интеграцию фильтрации дисперсии и проверки разреженности матриц. При тестировании на масштабном клиническом наборе данных, включающем 70 185 образцов и 466 видов, система показала ускорение в 26,1 раза на 64-ядерной архитектуре, сократив время вычислений с нескольких дней до считанных минут. Статистическая валидация подтвердила точность метода: согласованность направленности связей с оригинальными алгоритмами составила более 99,9%. Разработка критически важна для создания качественных топологических признаков, которые затем могут использоваться в глубоком обучении и трансформерных архитектурах для медицинской диагностики.
Компания Siemens Healthineers получила одобрение FDA на шесть новых систем визуализации платформы Artis, оснащенных технологией Optiq AI. Использование глубокого обучения позволяет системе в реальном времени анализировать и оптимизировать данные, обеспечивая высококачественное шумоподавление при проведении сложных интервенционных процедур.
GE HealthCare представила новые разработки в области МРТ, включая технологию ускорения Sonic DL на основе глубокого обучения и экосистему SIGNA One. Эти инновации направлены на сокращение времени сканирования, повышение качества изображений и оптимизацию рабочих процессов в клинических и исследовательских целях.
Исследователи представили eSIG-Net (edgetic mutation Sequence-based Interaction Grammar Network) — инновационную последовательностную «языковую модель взаимодействий», предназначенную для прогнозирования того, как одиночные мутации изменяют белковые взаимодействия. В основе метода лежит комбинация различных эмбеддингов белковых последовательностей и специализированный модуль кодирования мутаций, учитывающий синтаксические и эволюционные аспекты. Использование контрастивного обучения позволяет модели эффективно оценивать изменения в профилях взаимодействий, вызванных мутациями. Результаты тестов показали, что eSIG-Net значительно превосходит существующие современные методы, как основанные на последовательностях, так и на структурах белков. Модель способна с высокой степенью уверенности выявлять причинно-следственные варианты мутаций и объяснять их функциональную роль в биологическом контексте. Важным преимуществом является то, что eSIG-Net работает исключительно на основе информации о последовательностях, демонстрируя высокую обобщающую способность без необходимости в сложных структурных данных.
В статье представлено Carafe2 — инновационное программное обеспечение на базе глубокого обучения, предназначенное для создания высококачественных спектральных библиотек in silico специально для протеомики данных timsTOF. В отличие от существующих инструментов, которые либо не поддерживают ионную подвижность, либо обучаются на данных DDA (data-dependent acquisition), Carafe2 обучается непосредственно на экспериментальных DIA-данных, что минимизирует систематические ошибки. Разработчики провели тонкую настройку моделей предсказания времени удерживания (RT), интенсивности фрагментных ионов и ионной подвижности, используя нативные файлы формата Bruker .d без необходимости предварительной конвертации. Исследования на наборах данных глобального протеома, фосфопротеома и плазменного протеома показали, что модели Carafe2 превосходят предобученные DDA-модели по точности. Сравнительный анализ с такими инструментами, как AlphaPeptDeep и встроенные модели DIA-NN, подтвердил высокую эффективность Carafe2 в обнаружении пептидов. Данная разработка значительно повышает возможности количественного анализа белков в сложных биологических образцах, используя дополнительное измерение ионной подвижности.
Исследование посвящено использованию архитектур глубокого обучения (RNN, LSTM и Transformer) для распознавания физической активности и состояний стресса на основе данных с датчиков. Результаты показывают, что модели Transformer превосходят другие архитектуры, достигая точности 97,83%, что открывает перспективы для неинвазивного мониторинга психического здоровья через носимые устройства.
В статье представлен новый метод Scale-Consistent Attribution (SCA), который интегрирует клинические знания в процесс обучения нейросетей для анализа фонокардиограмм. Метод позволяет сделать объяснения ИИ более физиологически обоснованными, разделяя низкочастотные звуки сердца и высокочастотные шумы без потери точности классификации.
Данная работа представляет собой методологическое руководство по применению искусственного интеллекта для анализа данных жидкостной биопсии (LB) в онкологии. Авторы подчеркивают, что, несмотря на огромный потенциал неинвазивного обнаружения опухолевых биомаркеров, в литературе наблюдается дефицит исследований, успешно интегрирующих признаки LB с помощью ИИ. В статье предлагается структурированный подход к проектированию исследований, включая определение критериев отбора пациентов и выбор объема выборки. Особое внимание уделяется стратегиям предобработки данных: нормализации, коррекции батч-эффектов, а также методам обработки выбросов и пропущенных значений. Авторы рекомендуют использование различных алгоритмов машинного и глубокого обучения для селекции признаков с целью повышения робастности моделей. В работе также акцентируется необходимость проведения строгой внутренней и внешней валидации, а также оценки клинической применимости и интерпретируемости моделей, что является критическим фактором для их внедрения в реальную медицинскую практику.
Исследователи представили OpenBase — инновационную открытую платформу, предназначенную для стандартизации процессов генерации обучающих данных и глубокого обучения при идентификации различных неканонических оснований ДНК. Текущие методы нанопорового секвенирования ограничены лишь несколькими классическими эпигенетическими метками, что сужает возможности анализа химического разнообразия ДНК. OpenBase решает эту проблему, предлагая универсальный фреймворк для моделирования электрических сигналов, возникающих при прохождении молекул через нанопоры. Использование методов глубокого обучения позволяет достичь высокой точности распознавания на уровне единичных молекул, что критически важно для эпигенетических исследований. Данная разработка превращает нанопоровое секвенирование в широко доступный инструмент для детального изучения химической модификации генома. Внедрение OpenBase может значительно ускорить исследования в области молекулярной биологии и персонализированной медицины, предоставляя более глубокое понимание регуляторных механизмов ДНК.
Исследование посвящено изучению механизмов интерпретируемости предобученных геномных языковых моделей (gLM), в частности модели InstaDeeps Nucleotide Transformer v2 с 500 миллионами параметров. Авторы применили метод разреженных автоэнкодеров (SAE) ко всем 24 слоям энкодера для анализа латентных признаков. В ходе работы были построены графы знаний «последовательность-признак» для исследования пространства признаков SAE и проведено сравнение сообществ ДНК, связывающихся с цисплатином, и не связывающихся с ним с использованием центральности PageRank. Экспериментальные интервенции с использованием декодера и CNN-классификатора связывания показали асимметричные эффекты: подавляющие признаки могли полностью разрушить прогностический сигнал, в то время как признаки, связанные со связыванием, вызывали кумулятивный сдвиг предсказаний. Результаты доказывают, что представления gLM кодируют высокогранулярный синтаксис последовательностей и паттерны консервативности, ориентируясь на локальные биофизические ограничения, а не на сложные распределенные регуляторные логики. Это объясняет высокую эффективность моделей в молекулярных задачах при их относительной слабости в широком регуляторном выводе.
В данной научной работе, опубликованной в журнале npj Digital Medicine, представлен инновационный подход к использованию мультизадачного глубокого обучения (Multi-task deep learning) для автоматизации анализа нейровизуализационных данных. Исследование направлено на решение сложной задачи одновременного обнаружения и дифференциальной диагностики глиом и метастазов головного мозга на основе МРТ-снимков. Методология базируется на архитектуре нейронных сетей, способных обучаться нескольким задачам параллельно, что позволяет модели лучше улавливать общие признаки патологий и разделять специфические характеристики различных типов опухолей. Ключевым результатом является повышение точности сегментации и классификации новообразований по сравнению с традиционными однозадачными моделями. Разработанный алгоритм демонстрирует высокую чувствительность и специфичность, что критически важно для клинической практики. Внедрение подобных систем ИИ может существенно ускорить процесс постановки диагноза, снизить нагрузку на радиологов и минимизировать риск человеческой ошибки при интерпретации сложных снимков головного мозга.
В исследовании представлена инновационная модель глубокого обучения под названием GMAP, предназначенная для точного и быстрого прогнозирования молекулярных изменений в глиомах. Методология исследования основывается на многоцентровом ретроспективном анализе, что подтверждает надежность и масштабируемость предложенного подхода. Ключевым преимуществом GMAP является высокая интерпретируемость: анализ внимания модели (interpretability analysis) позволяет выявить конкретные признаки, на которые опирается ИИ при принятии решений. Это критически важно для повышения доверия врачей и успешного внедрения технологии в клиническую практику. Разработка представляет собой технически осуществимый и потенциально экономически эффективный метод диагностики, особенно актуальный для медицинских учреждений с ограниченными ресурсами. Использование модели позволяет автоматизировать сложный процесс идентификации биомаркеров, сокращая время постановки диагноза.
В данном исследовании представлена инновационная вычислительная платформа на базе глубокого обучения для анализа пространственной транскриптомики, направленная на изучение организации тканей и динамики их состояний. Авторы разработали фреймворк, использующий рекуррентный анализ латентных состояний тканей и графовые вложения для интеграции гетерогенных биологических систем, таких как заживление кожных ран и микроокружение опухолей (плоскоклеточный рак полости рта и головы/шеи). Методология включает в себя новый индекс патологической фрагментации, который количественно оценивает пространственную дезорганизацию внутри тканей. Результаты показали высокую точность моделирования: средний коэффициент силуэта (silhouette score) составил 0,79, что подтверждает четкое разделение состояний тканей. Исследование выявило, что при заживлении ран наблюдается прогрессивное восстановление пространственной организации, в то время как в опухолевых тканях фиксируется рост фрагментации и гетерогенности структуры. Полученные данные позволяют интерпретировать биологические процессы ремоделирования тканей через призму латентного пространственного анализа, что имеет критическое значение для персонализированной онкологии и регенеративной медицины.
В исследовании представлен Tsallis-Gated Autoencoder (Tsallis-GAE) — инновационная архитектура нейросети, разработанная для анализа геномной гетерогенности глиобластомы (GBM). Авторы заменили классический механизм softmax-внимания на обучаемый q-softmax на основе статистики Цаллиса, что позволяет модели лучше работать с «тяжелыми хвостами» распределений экспрессии генов. Исследование проводилось на когорте TCGA-GBM, включающей 391 образец и 2000 высоковариантных генов. Результаты показали, что Tsallis-GAE достигает среднего показателя AUC-ROC 0,977, что значительно превосходит стандартный автоэнкодер (Vanilla AE) с показателем 0,906. Ключевым открытием стало спонтанное схождение энтропийного индекса q к значению 1,554, что подтверждает неэкстенсивную природу сложных биологических систем и превосходство физико-информированного подхода над стандартными методами машинного обучения. Модель продемонстрировала высокую точность при кросс-валидации с другими детекторами аномалий, достигая AUC до 0,998.
В исследовании анализируется эффективность современных моделей глубокого обучения, предназначенных для предсказания химических пертурбаций (изменений экспрессии генов) на основе данных L1000. Авторы провели эксперимент, переобучив семь существующих моделей с нуля, используя нулевые или перемешанные входные данные о молекулярной структуре лекарств. Результаты показали, что при оценке на новых, ранее не встречавшихся соединениях (cold-drug evaluation), удаление молекулярных признаков практически не повлияло на точность прогнозов. Базовая модель MLP, использующая только базовую экспрессию клеточных линий, показала результаты, сопоставимые со специализированными архитектурами. Исследование доказывает, что текущие нейросетевые архитектуры не способны эффективно использовать химические свойства молекул для обобщения данных на новые препараты. Это подчеркивает критическую необходимость разработки новых подходов в биоинформатике для интеграции химической структуры в предсказательные модели.
В данном исследовании представлен новый унифицированный бенчмарк BGCs-Bench, предназначенный для оценки эффективности геномных языковых моделей (gLM) с поддержкой длинного контекста. Основное внимание уделено анализу биосинтетических генных кластеров (BGC) через решение трех ключевых задач: предсказание биосинтетического класса, таксономическая классификация и аннотация кодирующих последовательностей. Авторы провели систематическую послойную оценку эмбеддингов, доказав, что выбор конкретных слоев модели критически влияет на точность выполнения прикладных задач. С помощью анализа logit lens для авторегрессионных моделей на базе архитектуры StripedHyena было выявлено, что ранние слои отвечают за кодирование биологически значимой информации из последовательностей ДНК, в то время как глубокие слои оптимизированы для генерации последовательностей. Результаты работы предоставляют методологическую базу для более эффективной разработки и применения специализированных ИИ-моделей в геномике и синтетической биологии.
В данном исследовании используется глубокая нейросетевая модель AlphaGenome (sequence-to-function) для проверки гипотезы накопления соматических мутаций как причины старения тканей. Автор провел масштабное тестирование, оценивая транскрипционный эффект 4 000 случайных однонуклеотидных вариантов (SNV) в тканях толстой кишки, а также проанализировал реальный каталог соматических мутаций из работы Cagan et al. (Nature, 2022), включающий 54 158 замен и 9 799 инсерций/делеций. Методология включала симуляцию на уровне генных тел с использованием псевдо-bulk RNA-seq агрегации и сравнение результатов с данными GENCODE. Результаты показали, что распределение предсказанных изменений экспрессии, вызванных как случайными, так и реальными соматическими вариантами, на три-четыре порядка ниже, чем эндогенная транскрипционная программа старения тканей. Таким образом, исследование ставит под сомнение прямую связь между накоплением мутаций и возрастными изменениями в эпителии толстой кишки, указывая на то, что ключевую роль в старении играют эпигенетические и регуляторные механизмы, а не просто генетическая нестабильность.