Разработана нейросетевая модель OMNIS, которая интегрирует мультиомные данные в геномные изображения с учетом пространственной организации хромосом. Модель демонстрирует высокую точность в прогнозировании рецидивов рака и разграничении первичных и метастатических опухолей, а также позволяет выявлять ключевые гены-маркеры.
Исследование представляет MetaClaw — инновационный агентный фреймворк на базе больших языковых моделей (LLM), предназначенный для автоматизации сложных биоинформатических рабочих процессов. В отличие от существующих решений, MetaClaw обеспечивает полную воспроизводимость и аудируемость за счет разделения анализа на детерминированный поток FlowHub и настраиваемые контейнеры OpenClaw, объединенные единым реестром YAML-конвейеров. В ходе тестирования на 94 образцах из четырех опубликованных исследований система продемонстрировала высокую точность: восстановление 3/3 признаков рассеянного склероза (RRMS), 5/5 групп маркеров вечной мерзлоты и 3/5 маркеров колоректального рака (CRC). Бенчмаркинг показал, что использование целостной архитектуры реестра сокращает время выполнения задач на 32%, уменьшает количество вызовов инструментов на 37% и снижает затраты на токены на 47%. Система гарантирует безопасность данных, так как контейнеры для последующего анализа работают без доступа к сети. MetaClaw успешно решает проблему воспроизводимости выводов в мультиомных исследованиях, обеспечивая устойчивость к возмущениям и измеримую эффективность ресурсов.
Представлена GatorPrism — инновационная архитектура на основе смеси экспертов (Mixture-of-Experts), использующая самообучение и коалиционные графы для интеграции пространственных мультиомиксных данных. Методология системы позволяет разделять общий консенсус между различными омиксными слоями и специфические сигналы каждой модальности, адаптируя их вклад в зависимости от конкретной локации в ткани. В рамках модели совместный эксперт кодирует консенсусный граф на основе пересечений, а частные эксперты фиксируют уникальные пространственно-молекулярные структуры, при этом маршрутизатор на основе прототипов назначает веса для каждой точки ткани. В ходе тестирования на восьми наборах данных GatorPrism продемонстрировала превосходство над девятью конкурирующими методами по девяти метрикам кластеризации. Исследование на тканях миндалевидного железа человека подтвердило точность выделения доменов через соответствие маркерам RNA и ADT, а анализ эмбрионального мозга мыши выявил анатомически локализованные состояния, подтвержденные данными транскриптомики и доступности хроматина. Данная разработка обеспечивает высокую интерпретируемость и точность при изучении того, как молекулярные сигналы организуют структуру тканей.
В исследовании, опубликованном в журнале npj Digital Medicine, представлена инновационная методология использования машинного обучения для интеграции мультиомных данных с целью прогнозирования эффективности терапии у пациенток с раком яичников. Авторы разработали модель слияния данных (multi-omics fusion), которая объединяет геномные, транскриптомные и протеомные профили для создания комплексного биомаркерного ландшафта. Применение алгоритмов машинного обучения позволило значительно повысить точность предсказания ответа на химиотерапию по сравнению с традиционными методами анализа одиночных типов данных. Результаты исследования демонстрируют, что такая интеграция данных способствует переходу к прецизионному общественному здравоохранению, позволяя персонализировать протоколы лечения на популяционном уровне. Данная работа имеет критическое значение для онкологии, так как предлагает инструмент для минимизации неэффективных терапевтических вмешательств и оптимизации выбора лекарственных препаратов на основе глубокого молекулярного профилирования.
Исследование посвящено изучению специфического состояния микроглии (MG4), связанного с патологией болезни Альцгеймера (БА). С помощью интегративного анализа данных секвенирования РНК единичных ядер (snRNA-seq) из пяти независимых когорт (n=140 доноров) и подтверждения через ATAC-seq, ученые доказали воспроизводимость обогащения субпопуляции MG4 при БА (pooled log2 fold change = 0.90, p = 3.0 x 10^-4). В ходе работы были идентифицированы ключевые регуляторы MITF и BACH1, управляющие программой лизосомального закисления через V-ATPase и оттоком холестерина. Исследование выявило, что этот процесс отличается от программ DAM и LDAM, демонстрируя специфическое повышение энергетического метаболизма при БА. В качестве потенциальных апстрим-лигандов были определены FGF1 и TGFB2, что подтверждено пространственной транскриптомикой. Особую значимость для терапии представляет применение методов вычислительного репозиционирования лекарств, в результате которого было отобрано 10 соединений, способных проникать через гематоэнцефалический барьер, для дальнейшей функциональной валидации.
В исследовании представлен Histo3D-MO — инновационный гибридный экспериментально-вычислительный конвейер, предназначенный для реконструкции 3D-карт пространственного мультиомикса с разрешением на уровне отдельных клеток. Основная технология базируется на методе SPONGE, который интегрирует разреженные и несвязанные пространственные омиксные измерения с плотными данными гистологии (окрашивание гематоксилином и эозином). Разработанный алгоритмический комплекс позволяет проводить 3D-пропагацию типов клеток и аннотацию тканевых доменов, обеспечивая полную характеристику объема опухолевого микроокружения. При тестировании на данных гепатоцеллюлярной карциномы метод выявил сложные паттерны эффективности трансляции и траектории дифференцировки моноцитов в зависимости от глубины ткани. Histo3D-MO значительно превосходит существующие методы прогнозирования омиксных данных, предлагая масштабируемое решение для изучения организации сложных биологических систем. Это открывает новые возможности для высокоточной диагностики и понимания архитектуры опухолей на молекулярном уровне.
В статье представлен SHINE — инновационный вычислительный фреймворк на основе гиперграфов, предназначенный для совместного анализа пространственной экспрессии генов и метаболических сетей. Разработка решает критические проблемы мультиомиксных исследований: пространственное несовпадение данных, разницу в разрешении и сложные взаимодействия между транскриптомом и метаболомом. Методология SHINE использует обучение представлениям (representation learning) для интеграции данных, полученных с одного тканевого среза. В ходе тестирования на моделях болезни Паркинсона у мышей алгоритм успешно выявил области с истощением дофаминергических нейронов и реконструировал оси, связанные с дофамином. При анализе образцов рака легких и молочной железы у человека метод позволил точно сегментировать опухолевые микроокружения и идентифицировать пространственно организованные генно-метаболические программы. Технология демонстрирует высокую масштабируемость и точность в выявлении биомаркеров, что открывает новые возможности для прецизионной диагностики и понимания молекулярных механизмов заболеваний.
В статье представлен RomicsProcessor — инновационный программный пакет, разработанный для решения критической проблемы воспроизводимости в биоинформатике. Авторы предлагают парадигму «воспроизводимости по проекту», в основе которой лежит создание объекта 'Romics_object'. Этот цифровой артефакт является самодостаточным контейнером, который инкапсулирует полную историю данных: от исходного состояния до финальной обработки, включая все промежуточные шаги и зависимости. Методология была протестирована на различных сложных типах данных, включая объемную протеомику (bulk proteomics), крупномасштабную мультиплексную иммунофлуоресценцию и масс-спектрометрическую визуализацию (MSI) из нескольких партий. Результаты демонстрируют высокую масштабируемость и вычислительную мощность инструмента, обеспечивая соблюдение принципов FAIR (находимость, доступность, совместимость и повторное использование). Данная разработка служит фундаментом для создания следующего поколения биоинформатических инструментов, способных эффективно работать в эпоху искусственного интеллекта и ускорять биологические открытия.
В исследовании представлена новая мультиомиксная методология для функциональной характеристики фосфосайтов человека, которые до сих пор оставались малоизученными. Авторы предложили использовать обилие белков-партнеров в качестве индикатора влияния фосфорилирования на белковые взаимодействия, основываясь на том, что несвязанные субъединицы стабильных комплексов подвергаются деградации. С помощью модели вложенной линейной регрессии был проведен анализ пан-раковых данных 1 006 опухолей с учетом транскрипционных и других ковариат. В ходе работы выявлено 6 160 ассоциаций между 3 038 фосфосайтами и распространенностью взаимодействующих белков. Интеграция данных с предсказаниями AlphaFold позволила локализовать 239 сайтов непосредственно на интерфейсах взаимодействия, а еще 402 сайта были связаны с изменением локализации белков между клеточными компартментами. Экспериментальная проверка мутантов фосфосайтов NKAP и NUF2 методом масс-спектрометрии подтвердила точность предсказаний модели. Данный фреймворк создает структурированный ресурс для приоритезации изучения фосфопротеома человека.
Исследователи представили TMO (Temporal Multi-Omics) — инновационную архитектуру глубокого обучения, предназначенную для анализа временной динамики между доступностью хроматина (ATAC) и экспрессией генов (RNA). В отличие от существующих симметричных моделей, TMO использует механизм асимметричного кросс-модального внимания, что позволяет учитывать направленную связь и специфические временные задержки (regulatory lags), зависящие от текущего состояния клетки. Методология включает проекцию данных в латентные компоненты и использование двухпроходного трансформера с априорным смещением задержки, полученным через скользящую кросс-корреляцию. Тестирование на четырех наборах данных 10x Multiome (мозг и почки мышей, мозг и PBMC человека) показало выдающиеся результаты: показатели согласованности задержек (LCS) достигли 0.988–0.999 против 0.048–0.108 у симметричных моделей. Модель успешно выявила смену режимов регуляции: от ATAC-ведущего прайминга на ранних этапах развития до RNA-ведущей регуляции на поздних стадиях. Валидация через ChIP-seq и Perturb-seq (включая нокауты SMARCB1 и SMARCE1) подтвердила биологическую значимость выявленных паттернов, что делает TMO мощным инструментом для изучения механизмов клеточной дифференцировки и развития.
Исследователи представили HoloCell — первую в своем роде генеративную базовую модель (foundation model), предназначенную для совместного обучения представлениям и генеративного моделирования трех основных типов одноцепочечных омиксных данных: эпигеномики, транскриптомики и протеомики. Модель обладает колоссальным масштабом, содержая более 860 миллионов параметров, и прошла предварительное обучение на Human-Multi-Omics-Corpus, который включает около 468 миллионов профилей отдельных клеток и более 425 миллиардов токенов. В основе HoloCell лежит иерархическая стратегия токенизации, которая кодирует цис-регуляторные элементы, гены и белки как структурированные токены в единой архитектуре. Благодаря использованию механизмов итеративной диффузии и ремаскирования, модель демонстрирует превосходные результаты в задачах интеграции парных и непарных омиксных данных, а также в кросс-модальной генерации. HoloCell позволяет осуществлять in silico симуляцию потоков мультиомиксной информации, что делает её ключевым инструментом на пути к созданию концепции «виртуальной клетки». Это достижение открывает новые горизонты для системной характеризации клеточной гетерогенности и глубокого понимания биологических процессов на молекулярном уровне.
Исследование представляет Metadata Collector — специализированную веб-платформу (стек React/API/PostgreSQL), разработанную для решения проблемы хаотичного управления метаданными в проектах секвенирования следующего поколения (NGS). В рамках крупного немецкого исследовательского консорциума платформа была развернута в кластере Kubernetes для обеспечения соответствия принципам FAIR (находимость, доступность, совместимость и возможность повторного использования). Методология включает использование гибких машиночитаемых моделей данных, контролируемых словарей и системы версионирования на основе событий. В ходе эксплуатации система была применена в 32 проектах, охватывающих данные RNA-seq, scRNA-seq, ATAC-seq и мультиомные наборы, обеспечив аннотацию более 700 образцов от различных партнеров. Результаты демонстрируют, что внедрение платформы позволяет автоматизировать сбор данных и минимизировать ошибки ручного ввода, характерные для использования электронных таблиц. Инструмент имеет высокую значимость для организации биомедицинских исследований, так как позволяет интегрировать стандартизированные метаданные в существующие инфраструктуры управления данными и будущие конвейеры автоматизированной подачи в публичные репозитории.
В статье рассматривается критическая проблема интеграции искусственного интеллекта и мультиомиксных технологий (геномики, протеомики и др.) в практику прецизионной медицины. Авторы подчеркивают, что текущие регуляторные механизмы не успевают за темпами технологического прогресса, создавая разрыв между инновациями и их клиническим внедрением. Основное внимание уделяется вопросам целостности данных, прозрачности алгоритмов и необходимости интеграции доказательств из реальной клинической практики (RWE). В работе проводится сравнительный анализ регуляторных подходов в ЕС и США, выявляя существенные различия в классификации инструментов как медицинских изделий или фармацевтических препаратов. Исследование акцентирует внимание на необходимости создания новых стандартов валидации для ИИ-систем, которые анализируют сверхсложные биологические наборы данных. Результаты дискуссии указывают на то, что гармонизация правил станет ключевым фактором для безопасного и массового использования инструментов следующего поколения в диагностике и стратификации пациентов.
Исследователи представили PACMON — новую байесовскую модель латентных факторов, предназначенную для интерпретации результатов высокопроизводительного скрининга генов. В отличие от существующих методов, PACMON объединяет мультимодальные молекулярные измерения (например, РНК и поверхностные белки) с априорными биологическими знаниями о путях. Модель использует структурированные разреженные априорные распределения для сопоставления латентных факторов с известными биологическими путями, одновременно оценивая, как различные экспериментальные воздействия (пертурбации) активируют или подавляют эти программы. Тестирование на синтетических данных показало практически идеальное восстановление структуры путей, превосходящее текущие методы по точности и масштабируемости. При применении к данным Perturb-CITE-seq клеток меланомы модель успешно выявила программы интерферонного сигналинга и клеточного цикла. Особую значимость представляет применение PACMON к атласу пертурбаций Tahoe-100M, охватывающему около 100 миллионов клеток и более 1000 комбинаций доз лекарств, что позволило впервые провести анализ латентных факторов на уровне путей в таком масштабе и картировать ландшафты лекарственного ответа.
Исследователи представили Lemonite — новый вычислительный фреймворк, предназначенный для интеграции данных транскриптомики и метаболомики с целью выявления метаболитов, регулирующих экспрессию генов. В отличие от существующих методов, Lemonite не требует предварительного дифференциального анализа или полной аннотации метаболитов, что позволяет преодолеть ограничения интерпретируемости. Для контекстуализации прогнозов авторы создали масштабный граф знаний, объединяющий более 370 000 взаимодействий метаболит-ген и 2,1 миллиона белок-белковых взаимодействий. Применение метода к когортам пациентов с глиобластомой и воспалительными заболеваниями кишечника позволило выявить более 50 функционально когерентных генных модулей на каждую болезнь. В частности, при глиобластоме было установлено, что мио-инозитол и фосфатидилхолины совместно с фактором IRF6 регулируют мезенхимальные иммунные программы, локализованные в опухолевых макрофагах. Метод позволяет генерировать проверяемые экспериментально гипотезы, расширяя понимание регуляторного потенциала метаболома в рамках мультиомиксного анализа.
Исследователи представили MAAMOUL — новый вычислительный фреймворк, предназначенный для интеграции метагеномных и метаболомных данных с целью выявления функциональных изменений в микробиоме, связанных с заболеваниями. В отличие от традиционных методов, которые опираются на фиксированные границы метаболических путей, MAAMOUL использует знания о бактериальном метаболизме для построения глобальной сети и идентификации кастомных метаболических модулей. Применение метода к наборам данных пациентов с воспалительными заболеваниями кишечника (ВЗК/IBD) и синдромом раздраженного кишечника (СРК/IBS) показало высокую эффективность: были обнаружены специфические модули, которые пропускали стандартные методы анализа путей. В частности, при ВЗК выявлены нарушения метаболизма серы и ароматических аминокислот, а также усиление механизмов спасения нуклеотидов микробиомом. Для СРК характерны изменения в метаболизме пуринов и никотината/никотинамида. Данный подход позволяет проводить глубокую мультиомиксную интеграцию, раскрывая когерентные функциональные сдвиги, недоступные при раздельном анализе генов или метаболитов.
Представлена новая аналитическая платформа Shiny AMMOA, разработанная как графический интерфейс (GUI) на базе R Shiny для упрощения интегративного анализа мультиомных данных при изучении старения мышей. Инструмент позволяет исследователям проводить сквозной анализ транскриптомных, протеомных и метаболомных данных без необходимости глубоких навыков программирования. Платформа поддерживает тестирование дифференциальной экспрессии, анализ обогащения путей и визуализацию молекулярных изменений на диаграммах KEGG. В ходе тестирования Shiny AMMOA успешно воспроизвела ключевые результаты существующих исследований, выявив возрастные изменения в таких процессах, как ответ на несвернутые белки (UPR), организация внеклеточного матрикса и метаболические пути. Продукт демократизирует доступ к сложным биоинформатическим методам, позволяя экспериментальным биологам быстро приоритизировать биологические мишени и генерировать гипотезы на системном уровне. Платформа доступна как локально через GitHub, так и в облегченном веб-варианте.
Исследователи представили крупнейший на сегодняшний день мультиомный датасет нейроэндокринных опухолей легкого (lung NETs), охватывающий 201 участника и 294 опухоли. В состав набора данных включены результаты секвенирования РНК, метилирования (EPIC 850K) и полногеномного секвенирования, что позволяет детально изучать молекулярные группы новообразований. Особую ценность представляет мультирегиональное полногеномное секвенирование 41 пациента для оценки внутриопухолевой гетерогенности, а также пространственная протеомика (64 участника) и пространственная транскриптомика (4 участника). Набор также содержит гистопатологические изображения (WSI) для 212 случаев, что открывает возможности для использования алгоритмов глубокого обучения (deep learning) для идентификации морфологических признаков конкретных молекулярных групп. Данный ресурс предназначен для комплексной характеристики опухолей и интеграции данных на различных масштабах, обеспечивая воспроизводимость исследований благодаря предоставлению всех скриптов и обработанных данных.
Представлена ProteoPy — легковесная библиотека на языке Python, предназначенная для количественного анализа протеомики на уровнях белков и пептидов. В основе библиотеки лежит структура данных AnnData, что позволяет эффективно объединять биоинформатические данные с сохранением всей метаинформации в едином объекте. Ключевой особенностью является программная реализация алгоритма COPF, которая позволяет осуществлять вывод групп протеоформ непосредственно из пептидных данных. Это дает возможность исследователям идентифицировать специфическую регуляцию протеоформ и использование различных изоформ. Библиотека спроектирована для упрощения рабочих процессов как для специалистов, так и для пользователей без глубоких знаний в биоинформатике. ProteoPy бесшовно интегрируется с экосистемами scanpy и muon, обеспечивая масштабируемость и воспроизводимость мультиомиксного анализа. Инструмент доступен под лицензией Apache 2.0 на GitHub и включает обучающие ноутбуки для быстрой адаптации.
В исследовании представлен новый вычислительный фреймворк для пространственного вывода регуляторных программ, предназначенный для глубокого анализа меланомы. Авторы решают проблему разделения данных: пространственная транскриптомика (ST) дает информацию об архитектуре ткани, но не о регуляции, а мультиомные методы на уровне единичных клеток не сохраняют пространственный контекст. Предложенный метод интегрирует данные Visium ST с данными single-cell multiome, используя пространственно-регуляризованное картирование «клетка-пятно» (cell-to-spot mapping) на базе алгоритма GraphST. В ходе работы исследователи успешно перенесли данные о доступности хроматина и активности мотивов транскрипционных факторов непосредственно в тканевое пространство. Применение фреймворка к образцам меланомы позволило выявить локализованные в пространстве регуляторные программы, которые ранее были недоступны. Результаты показывают, что стратегия назначения клеток критически влияет на стабильность последующего регуляторного анализа. Данный модульный подход обеспечивает интерпретируемые данные на уровнях генов, пиков и транскрипционных факторов, что имеет высокую значимость для точной диагностики и понимания микроокружения опухоли.