Исследование представляет гибридную архитектуру CNN-RNN с использованием GAN для решения проблемы нехватки данных при классификации рака легких по КТ-снимкам. Предложенный метод достиг точности 92,84% и включает механизмы интерпретируемости через Grad-CAM и SHAP.
Исследователи разработали PhyloFM — фреймворк на основе flow-matching (машинное обучение), который интегрирует разнородные данные lineage-tracing с одноклеточной РНК-секвенацией и пространственной транскриптомикой для реконструкции непрерывной динамики клеточных судеб. Метод обучает поле скоростей и изменения относительной численности клеток на топологически регуляризованной латентной геометрии, предсказывая транспорт популяций, вероятности будущих судеб, время коммитмента и динамику экспрессии генов. PhyloFM протестирован на пяти бенчмарках: эмбриогенез C. elegans, гемопоэз LARRY, развитие вентрального среднего мозга pandaCREST, регенерация сердца у данио-рерио и пространственные опухоли eTracer. На данных C. elegans метод улучшил транспорт популяций на 17,3% и снизил ошибку динамики на 16,3% относительно state-of-the-art базлайнов, с уменьшением ошибки транспорта на 26,6% относительно lineage-aware контроля. На бенчмарке пространственных опухолей eTracer точность судьбы клонов увеличилась на 70,4% относительно лучшего пространственного базлайна, а 67% сопоставленных генов-репортёров показали корреляцию Пирсона r > 0,6. Результаты демонстрируют, что записи клеточного происхождения могут служить биологическими ограничениями для реконструкции интерпретируемой молекулярной динамики из одноклеточных снимков, что имеет значение для онкологии, регенеративной медицины и изучения развития тканей.
Исследователи представили DBayesCM — новую глубокую байесовскую модель для кластеризации и анализа взаимосвязей в микробиомных мульти-омикс данных. Модель сочетает глубокое обучение с байесовскими непараметрическими методами: отдельные энкодеры проецируют данные микробиома и хозяина в общее латентное пространство, где бесконечная смесь моделей с приором Дирихле автоматически определяет количество кластеров и квантует неопределённость назначения каждого образца. Авторы оценили две версии модели: DBayesCM-vMF с гиперсферическим латентным пространством и DBayesCM-GMM с евклидовым пространством. На симулированных данных гиперсферальный вариант корректно восстановил число кластеров, тогда как евклидовый допустил избыточную сегментацию, что демонстрирует влияние геометрии латентного пространства на качество кластеризации. Модель протестирована на когортах пациентов с раком толстой кишки, молочной железы и почек, включая метаболомику хозяина, RNA-seq и miRNA данные, а также на модели обструктивного апноэ сна. DBayesCM выявляет условные вероятностные совпадения между ключевыми видами микробов и омикс-признаками хозяина, обеспечивая осознанное исследование взаимосвязей микробиом-хозяин при различных заболеваниях с учётом неопределённости.
В статье рассматривается практический подход к адаптации и внедрению положений нового Закона ЕС об ИИ (EU AI Act) в деятельность крупного специализированного онкологического центра. Авторы предлагают комплексную модель институционального управления, которая позволяет интегрировать алгоритмы машинного обучения в клиническую практику, соблюдая строгие регуляторные требования. Исследование фокусируется на создании механизмов контроля качества данных, управлении рисками при использовании ИИ в диагностике рака и обеспечении прозрачности алгоритмов для врачей. Основное внимание уделяется созданию междисциплинарных комитетов, которые координируют работу технических специалистов и медицинского персонала. Разработанный фреймворк помогает минимизировать юридические риски и повысить безопасность пациентов при использовании высокорисковых систем ИИ. Данная работа имеет критическое значение для медицинских учреждений, стремящихся легально и эффективно масштабировать использование нейросетей в онкологии.
В статье описывается инновационный подход к внедрению федеративного обучения (Federated Learning) для задач цифровой гистопатологии в масштабах всей Германии. Исследование решает критическую проблему конфиденциальности данных, позволяя обучать высокоточные модели машинного обучения непосредственно в защищенных контурах медицинских учреждений без необходимости передачи чувствительных изображений тканей за пределы их локальных брандмауэров. Методология базируется на распределенной архитектуре, где только обновленные веса нейросетей, а не сами биомедицинские данные, передаются на центральный сервер для агрегации. Ключевым результатом является успешная демонстрация возможности создания мощных диагностических инструментов, способных работать с гетерогенными данными из различных клиник, сохраняя при этом полный комплаенс с требованиями защиты данных. Данная технология имеет колоссальное значение для развития прецизионной онкологии и стандартизации ИИ-диагностики в масштабах страны, преодолевая барьеры изоляции медицинских данных.
Разработан инструмент PredictRx, использующий шесть методов машинного обучения для анализа молекулярных структур и предсказания синергии лекарственных комбинаций. Исследование показало высокую эффективность алгоритма Random Forest в прогнозировании совместимости препаратов для терапии рака молочной железы.
В исследовании представлен RIPPLE (Replicate-Aware Inference of Paracrine Profiles via Likelihood Estimation) — новый программный пакет на языке R, предназначенный для анализа пространственной транскриптомики. Инструмент позволяет систематически декодировать межклеточные сигнальные пути, выявляя гены, экспрессия которых меняется в зависимости от расстояния до конкретного типа клеток. При тестировании на наборе данных 10x Xenium (мышиный лимфатический узел) алгоритм успешно восстановил каноническую программу ответа CCL21 в Т-клетках и подмножествах дендритных клеток с полной согласованностью знаков во всех образцах. В ходе анализа когорты немелкоклеточного рака легкого (CosMx) RIPPLE идентифицировал 515 генов градиента близости к опухоли, охватив 17 типов клеток. В частности, метод выделил IGFBP5 как ведущий маркер рак-ассоциированных фибробластов. Данная разработка предоставляет исследователям ранжированные списки паракриновых кандидатов, что критически важно для понимания микроокружения опухолей и разработки новых терапевтических стратегий.
В исследовании представлен новый вычислительный метод для анализа аллостерической коммуникации в белках, основанный на комбинаторном разложении Ходжа. Авторы применили этот подход к динамической модели гауссовской сети (dGNM), чтобы разделить поток энтропии переноса на три компонента: градиентный (глобальная иерархия от источника к стоку), роторный (локальная циркуляция) и гармонический (масштабные полости). На примере дикого типа белка KRAS и десяти его онкогенных вариантов (включая G12D, G12C, Q61R и др.) было доказано, что информационный поток является преимущественно иерархическим: градиентный член составляет 97,5–98,4% всего потока во всех протестированных вариантах. Исследование выявило, что мутации не меняют общую структуру потока, но перемещают основные источники аллостерических сигналов из гипервариабельной области С-конца в ядро обработки нуклеотидов и механизмы переключателей Switch I/II. Метод позволяет без введения дополнительных параметров на уровне отдельных аминокислотных остатков определять, как мутации различных механизмов перераспределяют пути передачи сигналов, что критически важно для понимания патогенеза рака.
Исследование посвящено изучению механизмов переключения изоформ РНК при карциноме Гюртля (HCC) — агрессивной форме рака щитовидной железы. Авторы провели реанализ набора данных NCBI GEO (GSE228870, n = 32), используя биоинформатические инструменты Salmon и IsoformSwitchAnalyzeR для выявления структурных изменений транскриптов. В ходе работы было обнаружено 371 переключение изоформ в 335 генах, что приводит к потере белковых доменов, укорочению открытых рамок считывания (ORF) и изменению субклеточной локализации белков. Наиболее значимые изменения зафиксированы в генах LAMA2, LSP1, MAD2L2, FBLN2 и CXCL12, что указывает на дисрегуляцию внеклеточного матрикса, иммунного сигналинга и ответа на повреждение ДНК. Установлено, что специфические изоформы LAMA2 и MAD2L2 отсутствуют в здоровой ткани щитовидной железы, что делает их потенциальными маркерами опухоли. Исследование впервые систематически описывает дисрегуляцию на уровне изоформ при HCC, выделяя альтернативное использование сайтов терминации и старта транскрипции как ключевые механизмы патогенеза.
Исследователи представили Human Developmental Lung Cell Atlas (HDLCA) — масштабный курируемый атлас респираторной системы, объединяющий 253 набора данных из 225 исследований. Проект охватывает более 18 миллионов клеток, полученных из 3 198 образцов 2 460 человек, охватывая 34 анатомические локации в состоянии здоровья и при патологиях. В ходе работы было определено 142 консенсусных типа клеток легких, включая 13 редких и 8 ранее не описанных типов. Ключевым открытием стало обнаружение редкой популяции промежуточных прогениторных альвеолярных эпителиальных клеток (Int AP), которые обладают транскрипционными признаками как клеток типа AT2, так и AT1. Траекторный анализ показал, что эти клетки возникают из AT2 и секреторных клеток SCGB1A1+, а их специализация регулируется сигнальным путем Hippo-YAP/TAZ. Установлено, что дисфункция Int AP клеток связана с генетической предрасположенностью к идиопатическому легочному фиброзу и ХОБЛ, что делает их потенциальной мишенью для регенеративной терапии. Данный атлас служит фундаментальной базой для картирования клеточного разнообразия и разработки новых стратегий клеточной терапии заболеваний легких.
В исследовании представлен инновационный фреймворк на базе глубокого обучения, предназначенный для автоматизированного анализа видеопотоков контрастно-усиленного ультразвукового исследования (CEUS) при оценке узлов щитовидной железы. Методология фокусируется на извлечении динамических признаков кровотока и текстурных характеристик новообразований для дифференциации доброкачественных и злокачественных поражений. Использование нейросетевых архитектур позволяет значительно повысить точность интерпретации видеоданных по сравнению с традиционными статичными изображениями. Ключевые результаты демонстрируют высокую чувствительность и специфичность алгоритма в выявлении признаков малигнизации, что критически важно для ранней диагностики рака щитовидной железы. Данная технология может быть интегрирована в системы поддержки принятия врачебных решений (СППВР) в отделениях радиологии, снижая риск человеческой ошибки и оптимизируя процесс подготовки к биопсии. Практическая значимость работы заключается в автоматизации сложного процесса анализа динамического контрастирования, что сокращает время диагностики и повышает точность клинических прогнозов.
Представлен Utanos — модульное программное решение (pipeline и R-пакет), предназначенное для анализа данных полногеномного секвенирования малой глубины (sWGS) по типу FASTQ-to-figures. Методология ориентирована на работу с относительно недорогим секвенированием (целевой объем около 15 миллионов чтений), что делает его экономически эффективной альтернативой глубокому WGS для масштабных исследований. Инструмент позволяет эффективно обнаруживать аберрации числа копий (CN), дефицит гомологичной рекомбинации (HRD) и формировать специфические сигнатуры числа копий. Разработка особенно актуальна для неонатальной диагностики и онкологических исследований, включая работу с образцами из блоков FFPE (фиксированных формалином и заключенных в парафин). Технически решение реализовано на базе кроссплатформенного фреймворка Nextflow с поддержкой Docker, что обеспечивает высокую воспроизводимость и стандартизацию выходных данных. Программное обеспечение доступно в открытом доступе на GitHub и подано на включение в экосистему nf-core.
Исследователи представили scOPE (single-cell Oncological Prediction Explorer) — новый метод анализа данных секвенирования РНК единичных клеток (scRNA-seq), предназначенный для выявления драйверных мутаций в опухолях. Основная проблема scRNA-seq заключается в том, что мутации трудно обнаружить из-за отсутствия экспрессии гена или неполного покрытия ридов, в то время как объемные (bulk) исследования дают точный генотип, но теряют клеточную гетерогенность. scOPE решает эту задачу, обучаясь на экспрессионных осях, связанных с драйверами в объемных опухолях, и проецируя на них транскриптомы отдельных клеток. В ходе тестирования 158 моделей драйверов в семи типах злокачественных новообразований было выявлено, что перенос программ экспрессии носит селективный характер. Наилучшие результаты показаны в случаях острых миелоидных лейкозов (AML, NPM1 AUROC 0.971), глиобластомы (IDH1 AUROC 0.963) и рака поджелудочной железы (KRAS AUROC 0.944). Разработанный метод оценки уверенности (confidence score) позволяет эффективно разделять поддерживаемые программы и шум, обеспечивая точность AUROC 0.85 в тестах на AML. Метод scOPE позволяет восстанавливать непрерывные транскрипционные оси, связанные с мутациями, и выявлять злокачественные популяции клеток, которые не видны при анализе только анеуплоидии.
В данном исследовании представлен инновационный метод количественной оценки микроокружения опухоли при колоректальном раке с использованием системы CAMuTILS. Авторы разработали алгоритм, позволяющий детально анализировать пространственную архитектуру и клеточный состав опухолевой ткани, что критически важно для персонализированной терапии. Методология базируется на интеграции цифровой патологии и передовых методов машинного обучения для точного подсчета различных типов иммунных и стромальных клеток. Ключевые результаты демонстрируют, что использование CAMuTILS позволяет значительно повысить точность прогнозирования выживаемости пациентов по сравнению с традиционными методами гистологического анализа. Исследование подтверждает высокую прогностическую значимость специфических паттернов микроокружения, что открывает новые возможности для стратификации рисков в онкологии. Практическая значимость работы заключается в возможности внедрения автоматизированного анализа цифровых слайдов в клиническую практику для оптимизации планов лечения пациентов с колоректальным раком.
Исследование сравнивает эффективность двух мультимодальных моделей (ChatGPT-5.4 и DeepSeek-VL2) в оценке узлов щитовидной железы по шкале C-TIRADS. ChatGPT-5.4 показал более высокие показатели точности и чувствительности, однако обе модели пока не могут использоваться для самостоятельной клинической диагностики.
В статье представлен Phenoverse — инновационный фреймворк глубокого обучения, предназначенный для анализа транскриптомики единичных клеток с целью выявления состояний заболеваний. Методология включает в себя остаточное кодирование с учетом типов клеток, прототипное обучение и агрегацию на основе архитектуры Perceiver. Исследователи протестировали систему на массивных когортах данных по COVID-19, болезни Альцгеймера и системной красной волчанке, охватывающих более 5 миллионов клеток. Результаты показали, что модель способна предсказывать состояния заболеваний и определять непрерывный спектр тяжести течения болезни на новых данных, даже если обучение проводилось только на бинарных метках. Важным достижением является высокая воспроизводимость молекулярных программ по сравнению с традиционными методами сравнения групп «случай-контроль». Благодаря прототипному обучению, Phenoverse обеспечивает внутреннюю интерпретируемость, позволяя характеризовать специфические для конкретных типов клеток изменения при патологиях, что критически важно для персонализированной медицины.
Исследование посвящено критическому анализу точности современных предикторов патогенности миссенс-вариантов (таких как AlphaMissense), которые часто ошибочно интерпретируют онкогенные мутации. Авторы протестировали 49 инструментов на базе 768 генов из Cancer Gene Census, используя данные из CIViC, COSMIC и ClinVar. Результаты показали, что 86% инструментов (42 из 49) систематически занижают значимость вариантов gain-of-function (GOF) по сравнению с опухолевыми супрессорами. Это связано с тем, что драйверные мутации часто локализуются в зонах с низкой консервативностью и высокой доступностью растворителю, что не учитывается текущими моделями. В работе предложен метод OncoCal — ансамбль моделей, который повышает показатель AUROC с 0.87 до 0.93 и успешно идентифицирует такие драйверы, как JAK2 V617F. Исследователи предоставляют открытую карту калибровки для каждого гена, что позволяет адаптировать существующие ИИ-инструменты для точной клинической интерпретации соматических мутаций в онкологии.
В статье представлен Tx2Mol — инновационный фреймворк, использующий транскриптомные данные для направленного дизайна новых лекарственных молекул. В отличие от традиционных методов, ориентированных на структуру мишени, Tx2Mol переводит сигнатуры экспрессии генов непосредственно в химические структуры, сохраняя биологическую направленность процесса. Исследование проводилось на трех уровнях: массовые изменения экспрессии генов, одноклеточные пертурбации и сигнатуры заболеваний, полученные от пациентов. Результаты тестирования на 10 бенчмарках, связанных с онкологией, показали превосходство Tx2Mol над 9 базовыми моделями: среднее улучшение максимального сходства Танимото с известными лигандами составило 24,10%, а для мишени HDAC1 этот показатель вырос на 50,67%. Система продемонстрировала способность генерировать химически правдоподобные и структурно новые молекулы, которые сохраняют предсказанный биологический ответ даже в условиях зашумленных профилей единичных клеток. Данная технология открывает новые возможности для приоритезации кандидатов в лекарства, основываясь на системном биологическом ответе, а не только на связывании с конкретным белком.
В исследовании применяется метод QTY-кода (замена гидрофобных аминокислот на полярные глутамин, треонин и тирозин) для создания водорастворимых аналогов ключевых мембранных белков вируса Эпштейна — Барр (BILF1, LMP1 и LMP2). Ученые использовали инструменты AlphaFold3, ColabFold и Boltz-2 для предсказания структур, что позволило подтвердить сохранение нативной конформации при значительной модификации последовательности. Результаты показали, что несмотря на замену 54,15%–61,59% аминокислот в трансмембранных доменах, значения RMSD остались крайне низкими (от 0,217 до 1,202 Å), а изменения молекулярной массы составили всего 0,7–1,2 кДа. Разработанные QTY-аналоги обладают существенно сниженной гидрофобностью и склонностью к агрегации, что позволяет проводить исследования без использования детергентов. Данный метод открывает новые возможности для биохимической характеризации белков EBV, которые ранее были труднодоступны из-за их гидрофобности, и может ускорить разработку терапевтических стратегий против связанных с вирусом злокачественных новообразований.
В статье представлена pyfraglib — комплексная программная платформа, предназначенная для глубокого анализа фрагментомики внеклеточной ДНК (cfDNA), включая профили длины фрагментов, показатели защиты (WPS) и мотивы концов фрагментов. Разработчики объединили в одном пакете инструменты для извлечения данных из коротких и длинных чтений секвенирования, статистическое моделирование (с использованием гауссовых смесей и NMF-декомпозиции) и модуль для in silico симуляций. В ходе тестирования на двух симулированных когортах по 20 образцов платформа успешно восстановила заданные различия в характеристиках фрагментов. Практическая значимость подтверждена на наборе из 89 образцов при лимфоме центральной нервной системы (CNSL): авторы разработали комбинированный фрагментомический показатель, объединяющий NMF-сигнатуры и мотивы концов фрагментов. Применение этого показателя на плазме пациентов позволило выявить группу высокого риска с худшей выживаемостью без прогрессирования заболевания (log-rank p=0.0205). Платформа доступна через Python API, интерфейс командной строки и конвейер Nextflow, что делает её мощным инструментом для биомедицинских исследований.