Разработана нейросетевая модель OMNIS, которая интегрирует мультиомные данные в геномные изображения с учетом пространственной организации хромосом. Модель демонстрирует высокую точность в прогнозировании рецидивов рака и разграничении первичных и метастатических опухолей, а также позволяет выявлять ключевые гены-маркеры.
Исследование посвящено проблеме воспроизводимости результатов при анализе данных секвенирования зарождающейся (nascent) РНК с использованием стандартных биоинформатических конвейеров. Авторы проанализировали публичные наборы данных человеческого PRO-seq и обнаружили, что идентичные входные данные приводят к значительным расхождениям в транскрипционных профилях из-за скрытых параметров обработки. Основные причины дивергенции включают взаимодействие между дизайном библиотек с парными концами, организацией UMI (уникальных молекулярных идентификаторов) и встроенными в алгоритмы правилами тримминга, выравнивания и генерации сигналов. Проблема подтвердилась на независимых библиотеках человека и свиньи, что указывает на системный характер ошибки, зависящей от архитектуры библиотеки, а не только от пользовательских настроек. В анализах GRO-seq было показано, что отсутствие обработки UMI может искажать профили позиционных сигналов, а неполные метаданные в PRO-cap и PRO-seq приводят к ошибкам выполнения или скрытой потере данных. Работа подчеркивает необходимость стандартизации метаданных и алгоритмических допущений для обеспечения точности биоинформатического анализа в геномике.
Компания Sonata представила инновационную модель подписки на услуги превентивного здравоохранения, которая интегрирует передовые технологии в повседневную медицинскую практику. В рамках программы участникам предлагается неограниченное непрерывное наблюдение со стороны лицензированных врачей, дополненное домашним тестированием крови и полногеномным секвенированием. Ключевой особенностью сервиса является использование клинического искусственного интеллекта для анализа полученных данных и поддержки принятия медицинских решений. Технология позволяет объединить генетические маркеры, биохимические показатели крови и клиническую экспертизу для формирования персонализированных планов профилактики. Данный подход направлен на переход от реактивной медицины к проактивной модели, где ИИ помогает выявлять риски заболеваний на ранних стадиях. Внедрение подобных систем может значительно повысить эффективность управления здоровьем населения за счет глубокой персонализации терапии.
Разработанная платформа Cell-Hub представляет собой комплексное программное обеспечение с открытым исходным кодом, предназначенное для упрощения сложного биоинформатического анализа данных секвенирования РНК единичных клеток (scRNA-seq). Инструмент реализован на базе R/Shiny и распространяется через Docker-контейнеры, что позволяет использовать его исследователям без навыков программирования. В единый интерфейс интегрированы ведущие аналитические библиотеки: Seurat 5 для кластеризации и нормализации, CellChat 2 для изучения межклеточных взаимодействий и Monocle 3 для построения траекторий развития клеток. Особое внимание уделено функционалу анализа лиганд-рецепторных взаимодействий, который опирается на базу данных GaspouDB, содержащую 11 563 взаимодействия для мышей и 9 604 для человека. Платформа охватывает полный цикл работ: от контроля качества и нормализации данных до поиска биомаркеров и интеграции нескольких наборов данных. Использование Cell-Hub значительно снижает порог вхождения в геномные исследования, обеспечивая получение визуализаций публикационного качества для широкого круга специалистов в области биомедицины.
В данном исследовании представлен комплексный бенчмарк фундаментальной геномной модели Evo 2 на массиве из 19 429 вирусных геномов из базы RefSeq. Авторы проанализировали способность модели Evo 2 (параметром 20 млрд) улавливать сложную архитектуру вирусных геномов, выходящую за рамки простого нуклеотидного состава. С помощью линейных зондов было установлено, что на оптимальном промежуточном слое модель достигает точности 0.96 в классификации классов по системе Балтимора и 0.99 в определении домена хозяина. Ключевым результатом стало то, что эмбеддинги модели значительно превосходят базовые показатели (6-мерный состав) в декодировании плотности генов (R=0.77), доли кодирующих последовательностей (R=0.61) и перекрытия генов (R=0.64). В задачах генерации фрагментированных геномов модель показала перплексию 1.18 бит/нт для бактериофагов и 1.80 бит/нт для вирусов эукариот. Исследование доказывает, что Evo 2 действительно кодирует функциональную архитектуру вирусных геномов, что открывает новые возможности для биоинформатического анализа и синтетической биологии.
В исследовании представлен новый биоинформатический подход для полногеномного поиска гомологов бактериальных некодирующих РНК (нРНК), который преодолевает ограничения традиционного поиска по сходству последовательностей. Методология объединяет предсказание субоптимальных вторичных структур с использованием алгоритма скользящего окна в межгенных областях (IGR) и анализ геномного синтенного порядка. Важной инновацией стало использование ChatGPT для автоматизации идентификации биологических связей между генами с различными функциональными аннотациями, что позволило уточнить контекст синтенного анализа. В ходе тестирования метода были успешно обнаружены новые гомологи РНК spot42 (ген spf) в геномах Glaciecola и Pseudoalteromonas, а также гены РНК ms1 в геномах Frankia и Bifidobacterium, которые ранее не удавалось идентифицировать стандартными методами. Результаты демонстрируют высокую эффективность интеграции структурных данных и ИИ-ассистированного анализа для расширения понимания регуляторных элементов бактериальных геномов.
Исследователи разработали REGA (Regulatory Elements Guided Analysis) — интерпретируемую программную платформу, предназначенную для реконструкции генных регуляторных сетей (GRN) на основе данных экспрессии генов. Методология REGA использует справочные каталоги регуляторных элементов (RE) для выявления программ взаимодействия транскрипционных факторов, регуляторных элементов и генов. В ходе тестирования на наборах данных ChIP-seq, Hi-C и eQTL метод показал превосходство над существующими базовыми моделями, даже превосходя алгоритмы, использующие большее количество входных данных. При применении к данным snRNA-seq из проекта PsychENCODE, REGA успешно идентифицировала модули, связанные с заболеваниями, и связала регуляторную дисрегуляцию с генетическими рисками. Кроме того, инструмент продемонстрировал эффективность в пространственной транскриптомике, связывая внутриклеточные регуляторные программы с межклеточной коммуникацией через лиганды и рецепторы. REGA представляет собой масштабируемое решение для глубокого понимания механизмов регуляции генов, что критически важно для поиска новых терапевтических мишеней.
Разработан комплексный программный инструментарий amR на языке R, предназначенный для прогнозирования антимикробной резистентности (AMR) на основе геномных данных. Пакет состоит из трех модулей: amRdata для автоматизированного сбора геномов и данных о чувствительности из базы BV-BRC, amRml для обучения интерпретируемых моделей машинного обучения и amRviz для интерактивной визуализации через Shiny-дашборды. Методология включает извлечение признаков на различных уровнях: от генных кластеров и доменов белков до структурных вариантов, используя эффективные форматы хранения Parquet и DuckDB. В ходе тестирования на патогене Shigella sonnei система показала высокую точность, достигнув медианного коэффициента корреляции Мэтьюса (MCC) 0,89 для 23 различных препаратов и классов антибиотиков. Инструментарий позволяет преодолеть проблему «черного ящика» в ИИ, предоставляя исследователям возможность интерпретировать механизмы резистентности и выявлять важные биомаркеры. Проект доступен в открытом доступе через GitHub под лицензией BSD-3-Clause.
Исследование посвящено проблеме надежности методов объяснимого искусственного интеллекта (xAI), таких как DeepLIFT, при анализе моделей «последовательность-активность» (S2A), которые предсказывают геномную активность (связывание транскрипционных факторов и экспрессию генов). Авторы изучают, может ли использование ансамблей моделей повысить точность интерпретации признаков, а не только точность самих предсказаний. В ходе работы было установлено, что ансамблирование атрибуций от нескольких моделей значительно улучшает результаты в прикладных задачах, таких как идентификация мотивов транскрипционных факторов и прогнозирование регуляторных генетических вариантов. Особое внимание уделено методу Monte Carlo Dropout (MCDropout), который показал эффективность, приближающуюся к обучению множества отдельных моделей, но при этом существенно снижающую вычислительные затраты на этапе обучения. Результаты работы критически важны для биоинформатики и персонализированной медицины, так как позволяют более точно интерпретировать влияние генетических мутаций на здоровье человека.
Anthropic запустила бета-версию Claude Science, которая интегрируется с инструментарием NVIDIA BioNeMo для ускорения биомедицинских исследований. Система позволяет ученым использовать естественный язык для управления сложными рабочими процессами, такими как предсказание структур белков и дизайн молекул, через специализированных ИИ-агентов.
В исследовании рассматривается двойственная природа вероятностного моделирования последовательностей и сжатия данных, где языковые модели используются как инструмент оценки качества генеративного моделирования ДНК. Авторы представили семейство из десяти моделей DNAGPT2 (архитектура GPT-2-small), предобученных на мультивидовом корпусе DNABERT2 с использованием одной видеокарты A40. Ключевым достижением стало достижение показателя 1.47 бит на основание (bpb) при сжатии генома человека T2T, что заняло четвертое место в бенчмарке Cobilab и превзошло все универсальные компрессоры общего назначения. Исследование выявило, что стандартная для NLP токенизация может быть неоптимальной для ДНК: словарь BPE размером в 32 токена показал лучшие результаты, чем более крупные словари. Также было обнаружено, что модели с коротким контекстом, использующие BPE, могут превосходить специализированные геномные модели с длинным контекстом из-за различий в архитектуре и данных. В завершение авторы создали карту информационной плотности генома человека, продемонстрировав статистически значимые различия в профилях информации между экзонами, интронами, межгенными участками и повторами Alu.
В исследовании представлен STAMO — инновационная модель на основе графовых нейронных сетей с механизмом внимания (graph attention neural network), предназначенная для интеграции пространственных мультиомиксных данных. Основная проблема существующих методов заключается в игнорировании пространственной информации при работе с непарными срезами тканей, что ведет к ошибкам при сопоставлении различных омиксных слоев. STAMO успешно решает эту задачу, обеспечивая точное выравнивание эмбеддингов и идентификацию консенсусных пространственных доменов. Методология была протестирована на различных типах данных, включая пространственный эпигеном, транскриптом, ДНК и белки. Результаты бенчмаркинга на парах эпигеном-транскриптом подтвердили превосходство STAMO над современными аналогами (state-of-the-art). Кроме того, модель позволяет осуществлять кросс-омиксную генерацию данных, что открывает новые возможности для изучения механизмов генной регуляции в специфических пространственных регионах тканей. Это имеет критическое значение для прецизионной медицины и понимания молекулярной архитектуры заболеваний.
В исследовании представлен SCOUT — масштабный ресурс синтетического полногеномного секвенирования более чем 200 образцов, предназначенный для систематической проверки методов анализа генома опухолей. В отличие от традиционных симуляций, SCOUT моделирует эволюцию опухоли как латентный генеративный процесс, который одновременно формирует мутации, изменения числа копий генов, частоту аллельных вариантов и клональную архитектуру. Авторы протестировали популярные методы детекции соматических вариантов и реконструкции эволюции, выявив, что их точность резко падает в условиях низкой чистоты опухоли и высокой субклональности. Исследование показало, что чистота опухоли оказывает более значительное влияние на точность выводов, чем глубина секвенирования. Также было установлено, что пространственная ошибка выборки и гипермутации создают ложные эволюционные сигналы, искажающие интерпретацию данных. SCOUT позволяет дифференцировать генетические «бутылочные горлышки» от динамики резистентности, связанной с пластичностью опухоли, что критически важно для разработки персонализированной терапии.
Исследовательская группа Yang et al. представила CrossDNA — инновационную и параметрически эффективную языковую модель, предназначенную для моделирования двуцепочечной структуры ДНК. В отличие от традиционных подходов, CrossDNA учитывает динамику взаимодействия между цепями ДНК, что позволяет более точно интерпретировать биологические функции последовательностей. Модель демонстрирует высокие показатели в стандартных бенчмарках, превосходя существующие аналоги в задачах понимания контекста генома. Ключевое практическое применение разработки заключается в интерпретации регуляторных областей генома и приоритизации не кодирующих вариантов (non-coding variants), что критически важно для генетической диагностики. Использование CrossDNA позволяет значительно повысить точность предсказания функциональных последствий мутаций, которые ранее было сложно классифицировать. Данная технология открывает новые возможности для персонализированной медицины и глубокого анализа геномных данных.
В статье представлен inquiSTR — новый специализированный программный инструментарий командной строки, предназначенный для высокоскоростного генотипирования длины тандемных повторов по всему геному. Тандемные повторы являются высокоизменяемыми элементами генома, которые играют ключевую роль в развитии различных человеческих заболеваний и формировании признаков. Разработчики внедрили в inquiSTR алгоритмы потоковой обработки с низким потреблением памяти и эффективную параллелизацию, что позволило достичь рекордной скорости: обработка каталога из 1,78 миллиона локусов занимает менее двух минут. Бенчмаркинг подтвердил высокую точность метода и значительное превосходство в производительности над существующими аналогами и эталонными наборами данных (truth sets). Помимо генотипирования, инструмент включает функционал для последующего биоинформатического анализа, включая определение популяционной структуры, проведение тестов на ассоциацию и поиск генетических аутлайеров. Данная разработка имеет высокую значимость для популяционной генетики и персонализированной медицины, ускоряя анализ данных полногеномного секвенирования длинными прочтениями.
Исследование представляет Hyper3D-lite — специализированный инструмент для аудита представления данных при анализе трехмерной структуры генома на основе технологий секвенирования длинных чтений (Oxford Nanopore, PacBio HiFi). Основная проблема, решаемая инструментом, заключается в искажении статистической значимости контактов: при стандартном попарном проецировании одна многоконтактная молекула может раздуваться до множества записей, создавая ложное впечатление избыточности биологических сигналов. Hyper3D-lite использует метод CPB (count-preserving statistical accounting) для обеспечения строгого статистического учета, сохраняющего исходное количество молекул. Методология позволяет сравнивать результаты стандартных проекций с консервативными оценками, отделяя широкомасштабные программные выводы от высокоточных кандидатов на высшие порядки контактов. Это критически важно для точной интерпретации хроматиновых конфигураций в геномике. Применение инструмента минимизирует риск ложноположительных результатов при анализе сложных многоконтактных взаимодействий в геноме.
В статье представлен ANCHOR — инновационный вычислительный фреймворк, предназначенный для анализа транскриптомов единичных клеток с использованием секвенирования РНК длинными чтениями. Методология ANCHOR объединяет в себе поиск вариантов на основе ориентированных графов (signed-graph variant caller), парное скрытое марковское моделирование и бета-биномиальную агрегацию UMI. Это позволяет проводить обнаружение экспрессируемых вариантов de novo, назначать гаплотипы на уровне отдельных молекул и количественно оценивать аллельную экспрессию для конкретных изоформ без необходимости в предварительно фазированном генотипе или использовании глубокого обучения. В ходе бенчмаркинга на данных человека ANCHOR продемонстрировал превосходство над существующими инструментами при низком и умеренном покрытии, а использование бета-биномиальной модели позволило значительно снизить количество ложноположительных результатов при тестировании аллель-специфичной экспрессии. Применение метода на данных мышиных эмбрионов в процессе гаструляции позволило успешно выявить специфичные для типов клеток импринтинговые эффекты и обнаружить антагонистическую матерински-смещенную изоформу гена Sgce. Данный инструмент открывает новые возможности для детального изучения диплоидных транскриптомов на уровне единичных клеток.
Исследователи представили GEOAgent — инновационную автономную систему, предназначенную для решения проблемы гетерогенности данных в базе Gene Expression Omnibus (GEO). Фреймворк объединяет семантическое управление и автоматизированный конвейер bioStream на базе Nextflow для интеллектуального поиска и стандартизации обработки данных. В рамках разработки метаданные 181 760 секвенирующих серий и 84 756 записей PubMed были систематизированы в реляционной базе данных и семантическом индексе, что позволяет осуществлять поиск датасетов с помощью запросов на естественном языке. Система автоматически определяет модальности анализов, разрешает зависимости в дизайне экспериментов и стандартизирует именование образцов, минимизируя ручную работу кураторов. В ходе экспертных тестов GEOAgent продемонстрировал точность поиска (precision) на уровне 96%, а также 100% точность в классификации типов анализов и определении взаимосвязей между образцами. Технология позволяет автоматически генерировать манифесты для запуска контейнеризированных рабочих процессов как для bulk, так и для single-cell омиксных данных, что значительно ускоряет биоинформатический анализ.
Обзор посвящен роли государственных суперкомпьютерных мощностей в трансформации биомедицинских исследований, включая онкологию и геномику. Особое внимание уделяется созданию национальных ИИ-моделей, таким как проект Великобритании по созданию вакцин против рака, а также вопросам управления данными и этики.
Исследователи представили CREP (Cis-Regulatory Element Predictor) — специализированную модель глубокого обучения, созданную путем тонкой настройки архитектуры Enformer для идентификации цис-регуляторных элементов (CRE), таких как энхансеры, промоторы и изоляторы. В отличие от стандартных моделей, предсказывающих непрерывные эпигеномные сигналы, CREP напрямую классифицирует типы регуляторных элементов на основе последовательности ДНК, используя аннотации REgulamentary для различных типов клеток человека. В ходе экспериментов было доказано, что включение данных по множеству клеточных линий критически важно для точности: например, модель успешно обнаружила вариант SNP Vanuatu, создающий новый эритроидный регуляторный элемент, только при наличии эритроидных данных в обучающей выборке. Анализ ошибок показал, что размытые границы между энхансерами и промоторами отражают их функциональную непрерывность, а не просто ошибки классификации. Данная разработка предоставляет мощный инструмент для функциональной интерпретации некодирующих генетических вариаций, что имеет решающее значение для понимания механизмов развития заболеваний, связанных с мутациями в некодирующих областях генома.