Разработана нейросетевая модель OMNIS, которая интегрирует мультиомные данные в геномные изображения с учетом пространственной организации хромосом. Модель демонстрирует высокую точность в прогнозировании рецидивов рака и разграничении первичных и метастатических опухолей, а также позволяет выявлять ключевые гены-маркеры.
В исследовании представлен grapHiC — инновационный метод на базе машинного обучения, предназначенный для фазирования гаплотипов при сборке генома de novo без использования родительских данных. Авторы переформулировали задачу фазирования как проблему кластеризации узлов с перекрывающимися кластерами на аугментированных графах унитигов, где узлы представляют фрагменты ДНК, а ребра кодируют перекрытия последовательностей или данные Hi-C близости. В основе метода лежит архитектура Graph Transformer и фреймворк контрастивного обучения с кастомной целевой функцией. grapHiC является первым подходом, способным проводить фазирование необработанных графов унитигов напрямую без предварительного упрощения и без привязки к референсному геному. Эксперименты на масштабе человеческого генома показали, что при интеграции с ассемблером DipGNNome метод обеспечивает непрерывность и качество фазирования, сопоставимое с современными передовыми технологиями (state-of-the-art). Данная разработка значительно упрощает процесс высококачественной сборки сложных геномов, автоматизируя разделение отцовских, материнских и гомозиготных участков.
Исследование посвящено анализу механизмов работы геномных фундаментальных моделей (Genomic Foundation Models) и выявлению того, какие именно слои нейросети наиболее важны для классификации генетических вариантов. Авторы исследуют разрыв между «репрезентативными» слоями (где пиковая точность одного признака) и «нагрузочными» слоями (на которые опирается итоговый классификатор). В ходе экспериментов на базе 8 008 вариантов из базы ClinVar использовались модели NT-v2 500M (MLM) и Evo 2 7B (CLM). Результаты показали, что эти слои не совпадают: в MLM-моделях нагрузочные слои находятся в середине-начале сети, а в гибридных CLM-моделях — глубоко в конце. Практическая значимость работы заключается в том, что использование стандартного последнего слоя (last-layer pooling) приводит к потере важного сигнала; например, в модели NT-v2 использование 1-мерного скаляра из среднего слоя повышает AUROC на 0,049 по сравнению с классическим 1024-мерным методом. Это дает четкое руководство для оптимизации архитектур при анализе генетических данных.
Представлен GeneAutomate — специализированный веб-инструмент для сравнительного анализа функциональной геномики, предназначенный для одновременной обработки двух списков генов (например, из разных групп лечения или тканей). В отличие от существующих сервисов вроде DAVID или Enrichr, работающих с одиночными списками, GeneAutomate реализует анализ обогащения (ORA) по базам Gene Ontology и Reactome, а также GSEA при наличии ранжированных данных. Уникальность архитектуры заключается в использовании предварительно скомпилированной офлайн-базы данных объемом 32 МБ, где все идентификаторы (Ensembl, Entrez, символы) сопоставлены с единым целочисленным индексом, что исключает задержки при запросах к серверам. Платформа предлагает 13 интерактивных видов визуализации на базе D3.js и Cytoscape.js, включая тепловые карты RRHO, «радарные» диаграммы функциональных отпечатков GO-slim и диаграммы перекрестных связей (chord diagrams). Инструмент позволяет извлекать подграфы белок-белковых взаимодействий (PPI) из базы BioGRID, обеспечивая глубокую интеграцию данных без необходимости локальной установки ПО или использования R/Bioconductor. На текущем этапе разработка ограничена только видами Homo sapiens и анализом не более трех списков одновременно.
В исследовании представлен новый метод интерпретируемости GDTR (Genomic Deep-Thinking Ratio), предназначенный для анализа геномных фундаментальных моделей без необходимости дополнительного обучения. Авторы используют подход через анализ остаточных потоков (residual-stream lens), чтобы определить «глубину стабилизации» каждого нуклеотидного токена — слой, на котором его представление становится стабильным относительно финального состояния модели. При тестировании на модели Evo 2 7B было обнаружено, что сайты сплайс-доноров и акцепторов стабилизируются примерно на два слоя раньше, чем интронные контексты. Исследование также показало, что нарушение канонического мотива GT в сайтах сплайсинга увеличивает глубину стабилизации, в то время как перемешивание окружающего контекста заставляет мотив стабилизироваться раньше. Кроме того, метод GDTR позволил выявить различия в глубине стабилизации для вариантов ClinVar, где синонимичные замены демонстрируют наибольшую глубину. Данный инструмент предоставляет новый вектор интерпретируемости для геномных моделей, дополняя существующие методы предсказания вариантов и оценки их последствий.
В статье представлен DPCGS — инновационный вычислительный фреймворк, предназначенный для интеграции статистик полногеномного поиска ассоциаций (GWAS) с данными секвенирования РНК единичных клеток (scRNA-seq). Основная цель метода заключается в преодолении сложности связи генетических вариантов с конкретными клеточными популяциями, что критически важно для понимания механизмов сложных заболеваний. Методология DPCGS базируется на гипотезе, что гены, приоритезированные в GWAS, демонстрируют повышенную экспрессию в соответствующих целевых клетках по сравнению с контрольными группами. Бенчмаркинг на симулированных данных подтвердил, что DPCGS превосходит существующие аналоги по точности и чувствительности при идентификации релевантных типов клеток. В ходе практического применения алгоритма были выявлены ключевые клеточные субпопуляции: олигодендроциты и астроциты при болезни Альцгеймера, а также макрофаги и B-клетки при астме. Кроме того, метод позволил определить потенциальные молекулярные регуляторы, такие как транскрипционные факторы CD74, FOS, FLI1 и AP-1. Данная разработка открывает новые возможности для поиска биомаркеров и разработки таргетной терапии.
Компания Tempus, специализирующаяся на использовании данных и ИИ в медицине, объявила о стратегическом приобретении компании Personalis, эксперта в области геномики рака, за 1,5 миллиарда долларов. Данная сделка завершает трехлетнее партнерство между компаниями и направлена на значительное расширение возможностей Tempus в области онкологической диагностики. Интеграция технологий Personalis позволит Tempus глубже анализировать генетические данные пациентов, что критически важно для разработки персонализированных планов лечения. Основная цель сделки — объединение мощных аналитических платформ для ускорения выявления биомаркеров и улучшения точности прогнозов в онкологии. Это приобретение укрепляет позиции Tempus как лидера в области применения больших данных и машинного обучения для прецизионной медицины. Для клинической практики это означает потенциальное ускорение доступа к высокоточным генетическим тестам, основанным на глубоком анализе данных.
В исследовании представлен новый метод быстрого обучения биологически информированных нейронных сетей (BINN), которые интегрируют биологические пути и белковые взаимодействия непосредственно в архитектуру нейросети. Исследователи протестировали модель на масштабных данных UK Biobank, охватывающих около 500 000 человек, используя генотипические и протеомные данные для анализа шести распространенных заболеваний. Работа выявила две критические проблемы интерпретируемости: систематическую предвзятость оценок атрибуции из-за топологии графа и феномен «прогностической множественности», когда разные модели с одинаковой архитектурой приходят к разным биологическим выводам при схожей точности. Однако авторы доказывают, что эта множественность может быть полезна: при анализе 100 реплик BINN для диабета 2 типа были обнаружены кластеры решений, фокусирующиеся на разных механизмах (воспалительном или печеночно-метаболическом). Это позволяет использовать вариативность объяснений ИИ как инструмент для изучения гетерогенности сложных заболеваний и поиска различных биологических путей их развития.
Представлен SMART (Somatic Mutation Annotation and Reporting Tool) — специализированный Docker-контейнеризированный конвейер для интерпретации соматических вариантов в онкологических панелях. Основная проблема, которую решает инструмент, заключается в непоследовательной приоритизации транскриптов и сложности интеграции доказательной базы OncoKB в воспроизводимые исследовательские процессы. Методология SMART включает объединение данных из VEP, CIViC, Cancer Hotspots, ClinVar, SpliceAI, REVEL, LOEUF и gnomAD с применением единой трехступенчатой системы приоритизации транскриптов (whitelist > MANE Select > VEP fallback). Инструмент интегрирует уровни доказательности OncoKB (терапевтические, резистентность, диагностические, прогностические и уровни FDA) непосредственно в VCF-рабочий процесс. Валидация системы показала полную согласованность (100% совпадение) по 804 проверкам на уровне полей при сравнении с эталонными API. SMART генерирует три типа выходных данных, адаптированных для вычислительных, биоинформатических и исследовательских задач, что значительно ускоряет процесс интерпретации геномных данных в онкологии.
Исследование посвящено разработке метода идентификации G-квадруплексов (G4) и других неканонических структур ДНК с использованием технологии секвенирования Oxford Nanopore (ONT). Авторы преодолевают ограничения традиционного короткопрочтения, такие как GC-смещение и низкое разрешение, применяя прямое секвенирование единичных молекул. В ходе экспериментов с использованием перманганата калия, окисляющего одноцепочечную ДНК, было установлено, что профиль ошибок при секвенировании G4-мотивов напрямую зависит от их исходного структурного состояния. Для анализа сырых данных электрического тока ONT были протестированы алгоритмы машинного обучения: логистическая регрессия, случайный лес, XGBoost и одномерные сверточные нейронные сети (1D CNN). Применение этих моделей позволило с точностью около 90% дифференцировать прочтения, происходящие от G4-мотивов, от прочтений в стандартной B-форме ДНК. Метод показал высокую эффективность при работе с модифицированной перманганатом ДНК, сохраняя длину прочтений и точность выравнивания. Полученные результаты открывают возможности для высокоточного картирования одноцепочечных участков ДНК в живых клетках, что критически важно для понимания механизмов геномной нестабильности.
Исследователи представили первую комплексную базу данных локусов синтеза капсулы (K-локусов), специально разработанную для комплекса видов Klebsiella oxytoca (SC), который является растущей группой оппортунистических патогенов в медицинских учреждениях. В работе описывается создание базы, включающей 88 различных локусов, определенных по составу генов, которая полностью совместима с инструментом быстрого геномного типирования Kaptive. Методология исследования включала анализ 2 244 геномов, что позволило достичь покрытия в 97,6%, значительно превосходя показатели существующей базы для K. pneumoniae (50,3%, p < 0,0001). Проверка базы на трех различных коллекциях клинических изолятов (от 61 до 102 генома в каждой) подтвердила высокую диверсификацию типов капсул. Данный ресурс критически важен для эпидемиологического надзора и разработки новых методов терапии, таких как вакцины, моноклональные антитела и фаговая терапия. База данных доступна в открытом доступе на GitHub и станет ключевым инструментом для системных геномных исследований патогена.
Исследование посвящено проблеме воспроизводимости результатов при анализе данных секвенирования зарождающейся (nascent) РНК с использованием стандартных биоинформатических конвейеров. Авторы проанализировали публичные наборы данных человеческого PRO-seq и обнаружили, что идентичные входные данные приводят к значительным расхождениям в транскрипционных профилях из-за скрытых параметров обработки. Основные причины дивергенции включают взаимодействие между дизайном библиотек с парными концами, организацией UMI (уникальных молекулярных идентификаторов) и встроенными в алгоритмы правилами тримминга, выравнивания и генерации сигналов. Проблема подтвердилась на независимых библиотеках человека и свиньи, что указывает на системный характер ошибки, зависящей от архитектуры библиотеки, а не только от пользовательских настроек. В анализах GRO-seq было показано, что отсутствие обработки UMI может искажать профили позиционных сигналов, а неполные метаданные в PRO-cap и PRO-seq приводят к ошибкам выполнения или скрытой потере данных. Работа подчеркивает необходимость стандартизации метаданных и алгоритмических допущений для обеспечения точности биоинформатического анализа в геномике.
Компания Sonata представила инновационную модель подписки на услуги превентивного здравоохранения, которая интегрирует передовые технологии в повседневную медицинскую практику. В рамках программы участникам предлагается неограниченное непрерывное наблюдение со стороны лицензированных врачей, дополненное домашним тестированием крови и полногеномным секвенированием. Ключевой особенностью сервиса является использование клинического искусственного интеллекта для анализа полученных данных и поддержки принятия медицинских решений. Технология позволяет объединить генетические маркеры, биохимические показатели крови и клиническую экспертизу для формирования персонализированных планов профилактики. Данный подход направлен на переход от реактивной медицины к проактивной модели, где ИИ помогает выявлять риски заболеваний на ранних стадиях. Внедрение подобных систем может значительно повысить эффективность управления здоровьем населения за счет глубокой персонализации терапии.
Разработанная платформа Cell-Hub представляет собой комплексное программное обеспечение с открытым исходным кодом, предназначенное для упрощения сложного биоинформатического анализа данных секвенирования РНК единичных клеток (scRNA-seq). Инструмент реализован на базе R/Shiny и распространяется через Docker-контейнеры, что позволяет использовать его исследователям без навыков программирования. В единый интерфейс интегрированы ведущие аналитические библиотеки: Seurat 5 для кластеризации и нормализации, CellChat 2 для изучения межклеточных взаимодействий и Monocle 3 для построения траекторий развития клеток. Особое внимание уделено функционалу анализа лиганд-рецепторных взаимодействий, который опирается на базу данных GaspouDB, содержащую 11 563 взаимодействия для мышей и 9 604 для человека. Платформа охватывает полный цикл работ: от контроля качества и нормализации данных до поиска биомаркеров и интеграции нескольких наборов данных. Использование Cell-Hub значительно снижает порог вхождения в геномные исследования, обеспечивая получение визуализаций публикационного качества для широкого круга специалистов в области биомедицины.
В данном исследовании представлен комплексный бенчмарк фундаментальной геномной модели Evo 2 на массиве из 19 429 вирусных геномов из базы RefSeq. Авторы проанализировали способность модели Evo 2 (параметром 20 млрд) улавливать сложную архитектуру вирусных геномов, выходящую за рамки простого нуклеотидного состава. С помощью линейных зондов было установлено, что на оптимальном промежуточном слое модель достигает точности 0.96 в классификации классов по системе Балтимора и 0.99 в определении домена хозяина. Ключевым результатом стало то, что эмбеддинги модели значительно превосходят базовые показатели (6-мерный состав) в декодировании плотности генов (R=0.77), доли кодирующих последовательностей (R=0.61) и перекрытия генов (R=0.64). В задачах генерации фрагментированных геномов модель показала перплексию 1.18 бит/нт для бактериофагов и 1.80 бит/нт для вирусов эукариот. Исследование доказывает, что Evo 2 действительно кодирует функциональную архитектуру вирусных геномов, что открывает новые возможности для биоинформатического анализа и синтетической биологии.
В исследовании представлен новый биоинформатический подход для полногеномного поиска гомологов бактериальных некодирующих РНК (нРНК), который преодолевает ограничения традиционного поиска по сходству последовательностей. Методология объединяет предсказание субоптимальных вторичных структур с использованием алгоритма скользящего окна в межгенных областях (IGR) и анализ геномного синтенного порядка. Важной инновацией стало использование ChatGPT для автоматизации идентификации биологических связей между генами с различными функциональными аннотациями, что позволило уточнить контекст синтенного анализа. В ходе тестирования метода были успешно обнаружены новые гомологи РНК spot42 (ген spf) в геномах Glaciecola и Pseudoalteromonas, а также гены РНК ms1 в геномах Frankia и Bifidobacterium, которые ранее не удавалось идентифицировать стандартными методами. Результаты демонстрируют высокую эффективность интеграции структурных данных и ИИ-ассистированного анализа для расширения понимания регуляторных элементов бактериальных геномов.
Исследователи разработали REGA (Regulatory Elements Guided Analysis) — интерпретируемую программную платформу, предназначенную для реконструкции генных регуляторных сетей (GRN) на основе данных экспрессии генов. Методология REGA использует справочные каталоги регуляторных элементов (RE) для выявления программ взаимодействия транскрипционных факторов, регуляторных элементов и генов. В ходе тестирования на наборах данных ChIP-seq, Hi-C и eQTL метод показал превосходство над существующими базовыми моделями, даже превосходя алгоритмы, использующие большее количество входных данных. При применении к данным snRNA-seq из проекта PsychENCODE, REGA успешно идентифицировала модули, связанные с заболеваниями, и связала регуляторную дисрегуляцию с генетическими рисками. Кроме того, инструмент продемонстрировал эффективность в пространственной транскриптомике, связывая внутриклеточные регуляторные программы с межклеточной коммуникацией через лиганды и рецепторы. REGA представляет собой масштабируемое решение для глубокого понимания механизмов регуляции генов, что критически важно для поиска новых терапевтических мишеней.
Разработан комплексный программный инструментарий amR на языке R, предназначенный для прогнозирования антимикробной резистентности (AMR) на основе геномных данных. Пакет состоит из трех модулей: amRdata для автоматизированного сбора геномов и данных о чувствительности из базы BV-BRC, amRml для обучения интерпретируемых моделей машинного обучения и amRviz для интерактивной визуализации через Shiny-дашборды. Методология включает извлечение признаков на различных уровнях: от генных кластеров и доменов белков до структурных вариантов, используя эффективные форматы хранения Parquet и DuckDB. В ходе тестирования на патогене Shigella sonnei система показала высокую точность, достигнув медианного коэффициента корреляции Мэтьюса (MCC) 0,89 для 23 различных препаратов и классов антибиотиков. Инструментарий позволяет преодолеть проблему «черного ящика» в ИИ, предоставляя исследователям возможность интерпретировать механизмы резистентности и выявлять важные биомаркеры. Проект доступен в открытом доступе через GitHub под лицензией BSD-3-Clause.
Исследование посвящено проблеме надежности методов объяснимого искусственного интеллекта (xAI), таких как DeepLIFT, при анализе моделей «последовательность-активность» (S2A), которые предсказывают геномную активность (связывание транскрипционных факторов и экспрессию генов). Авторы изучают, может ли использование ансамблей моделей повысить точность интерпретации признаков, а не только точность самих предсказаний. В ходе работы было установлено, что ансамблирование атрибуций от нескольких моделей значительно улучшает результаты в прикладных задачах, таких как идентификация мотивов транскрипционных факторов и прогнозирование регуляторных генетических вариантов. Особое внимание уделено методу Monte Carlo Dropout (MCDropout), который показал эффективность, приближающуюся к обучению множества отдельных моделей, но при этом существенно снижающую вычислительные затраты на этапе обучения. Результаты работы критически важны для биоинформатики и персонализированной медицины, так как позволяют более точно интерпретировать влияние генетических мутаций на здоровье человека.
Anthropic запустила бета-версию Claude Science, которая интегрируется с инструментарием NVIDIA BioNeMo для ускорения биомедицинских исследований. Система позволяет ученым использовать естественный язык для управления сложными рабочими процессами, такими как предсказание структур белков и дизайн молекул, через специализированных ИИ-агентов.