Разработана система классификации состояния плода (норма, подозрение, патология) на основе анализа данных кардиотокографии. Лучшая модель LightGBM показала точность 96.03% и была интегрирована в веб-приложение для поддержки принятия клинических решений.
В исследовании представлен SST-MAE — инновационный фреймворк на основе самообучения (self-supervised learning), предназначенный для анализа гиперспектральных данных развития растений. Основная проблема текущих методов заключается в необходимости дорогостоящей аннотации признаков и игнорировании временной динамики роста. Авторы предложили архитектуру Masked Autoencoder (MAE), которая обучается восстанавливать скрытую информацию из траекторий развития, не требуя фенотипических меток. Модель была протестирована на 194 генотипах салата, собранных в полевых условиях в восьми временных точках. Результаты показали высокую эффективность: показатель AUROC превысил 0,89 для SNP, отвечающих за пигментацию антоцианами, и составил 0,77 для признака зазубренности листьев. Важным преимуществом является высокая эффективность использования данных: модель достигает показателей, близких к полному набору размеченных данных, используя всего 30-50% аннотаций. Данная технология открывает путь к масштабируемому высокопроизводительному генетическому скринингу на основе изображений.
Представлен новый фреймворк RAG-GNN, объединяющий графовые нейронные сети с модулем плотного поиска по текстовому корпусу для улучшения анализа белковых взаимодействий. Исследование показало, что использование механизмов RAG позволяет улучшить функциональную кластеризацию белков по сравнению с классическими GNN-моделями.
Исследование оценивает возможность использования расхождений между различными системами автоматического распознавания речи (ASR) для выявления ошибок в медицинских транскриптах. Результаты показывают, что низкий уровень согласия между моделями эффективно локализует зоны неопределенности, позволяя человеку сосредоточиться на критических участках текста.
В данном исследовании изучается эффективность использования представлений (эмбеддингов) от крупной белковой модели-основания AINN-P1, обученной авторегрессионным методом на десятках миллионов последовательностей, для задачи ранжирования пар антиген-антитело по их аффинности (свободной энергии связывания ΔΔG). Авторы сравнивают специализированную модель, обученную с нуля, с легковесными надстройками (downstream heads), построенными поверх «замороженных» эмбеддингов AINN-P1. Результаты показали, что даже простая линейная модель на базе замороженных эмбеддингов превосходит базовую модель, обученную end-to-end. При использовании оптимизированной легковесной надстройки средняя корреляция Спирмена выросла с 0,42 до 0,53, что составляет относительное улучшение на 28%. Важно отметить, что обучение таких моделей занимает считанные секунды и не требует дорогостоящего дообучения (fine-tuning) самой фундаментальной модели. Это делает использование замороженных эмбеддингов высокоэффективным и экономичным методом для инженерии антител и предсказания их связывающей способности.
Исследование представляет TEDlm — новый класс языковых моделей белков, которые обучаются на сегментах структурно определенных доменов, а не на полноразмерных последовательностях. В отличие от стандартных моделей (например, ESM2), TEDlm фокусируется на очищенных сигналах фолдов, исключая линкеры и неупорядоченные области. Авторы предложили вариант TEDlm3D, использующий функцию потерь на основе контактов (C distance-guided contact loss) для супервизии карт внимания. В тестах на обнаружение удаленного гомологичного сходства (CATH S40, <40% идентичности) модель TEDlm с 650 млн параметров показала AUROC 0.28, что превосходит 3-миллиардную ESM2 (0.22), а версия TEDlm3D достигла AUROC 0.50, вплотную приблизившись к результатам структурного инструмента Foldseek (0.53). Кроме того, TEDlm демонстрирует значительное улучшение в zero-shot предсказании молекулярных функций и сохраняет высокую точность в задачах биофизических свойств. Результаты доказывают, что доменно-ориентированное предобучение позволяет создавать компактные и структурно информированные модели, эффективные для биоинформатики и разработки лекарств.
Исследователи представили elDORS — специализированную базу данных последовательностей РНК, разработанную для преодоления дефицита консолидированных ресурсов в области вычислительного предсказания структур. В основе проекта лежит elDORS_raw, объединяющий актуальные данные метагеномов и транскриптомов, а также оптимизированная версия elDORS с кластеризацией по 80% идентичности последовательностей. Данная база данных предназначена для использования в стратегиях разделения RNAcmap3 и стандартном конвейере rMSA для множественного выравнивания последовательностей (MSA). Бенчмаркинг показал, что использование elDORS позволяет достичь глубины выравнивания, сопоставимой или превосходящей показатели массивных устаревших баз данных, включая задачи слепых испытаний CASP. Ключевым преимуществом является решение проблемы поиска для «сиротских» РНК (orphan RNAs), где ранее наблюдались сбои при извлечении последовательностей. База данных предоставляется в свободный доступ и может применяться для гомологичного поиска, предсказания свойств РНК и обучения новых моделей машинного обучения.
В исследовании представлен Histo3D-MO — инновационный гибридный экспериментально-вычислительный конвейер, предназначенный для реконструкции 3D-карт пространственного мультиомикса с разрешением на уровне отдельных клеток. Основная технология базируется на методе SPONGE, который интегрирует разреженные и несвязанные пространственные омиксные измерения с плотными данными гистологии (окрашивание гематоксилином и эозином). Разработанный алгоритмический комплекс позволяет проводить 3D-пропагацию типов клеток и аннотацию тканевых доменов, обеспечивая полную характеристику объема опухолевого микроокружения. При тестировании на данных гепатоцеллюлярной карциномы метод выявил сложные паттерны эффективности трансляции и траектории дифференцировки моноцитов в зависимости от глубины ткани. Histo3D-MO значительно превосходит существующие методы прогнозирования омиксных данных, предлагая масштабируемое решение для изучения организации сложных биологических систем. Это открывает новые возможности для высокоточной диагностики и понимания архитектуры опухолей на молекулярном уровне.
Исследование оценивает эффективность использования состязательного обучения с использованием слоя реверсии градиента (GRL) для снижения возрастного смещения при прогнозировании диабета. Результаты показывают, что метод может улучшить полноту (recall) для малопредставленных возрастных групп, но не гарантирует стабильного улучшения справедливости из-за чувствительности к разбиению данных.
В исследовании представлен фреймворк APFA для федеративного обучения в сетях интернета медицинских вещей (IoMT). Метод позволяет эффективно объединять данные с различных устройств, решая проблемы вычислительной асимметрии и статистической неоднородности при сохранении конфиденциальности.
Исследование посвящено использованию модели BioBERT для автоматической маркировки поведенческих признаков аутизма согласно критериям DSM-5. Установлено, что описания от родителей (lay narratives) обладают высокой диагностической ценностью, сопоставимой с клиническими записями, и могут быть интегрированы в рабочий процесс для ускорения диагностики.
В исследовании представлена новая архитектура Ac-AI, объединяющая автоэнкодеры для извлечения скрытых признаков и адаптивные пороги принятия решений. Предложенный метод демонстрирует высокую точность и стабильность в прогнозировании сердечно-сосудистых рисков, сопоставимую или превосходящую классические модели вроде XGBoost и SVM.
Исследование посвящено использованию алгоритмов машинного обучения (XGBoost, Random Forest и др.) для прогнозирования риска инфекций (RTI/STI) у молодых женщин. С помощью анализа SHAP были выявлены ключевые факторы риска, а модель XGBoost показала высокую точность прогнозирования (89.1%).
Исследователи представили gANCHOR — инновационную базовую модель (foundation model) для анализа CAR T-клеточной терапии, использующую иерархический гиперграфовый механизм внимания. В отличие от существующих методов, gANCHOR интегрирует генно-путевые взаимосвязи через биологически обоснованное обучение представлений, что позволяет эффективно переходить от анализа отдельных клеток к прогнозированию клинического ответа пациента. Модель демонстрирует высокую устойчивость к эффекту батч-коррекции и сохраняет биологическую консервативность данных. При тестировании на выборке из 161 пациента, охватывающей пять различных исследований CAR T-клеточной терапии, gANCHOR показала выдающийся результат с F1-score 0,87, превзойдя существующие специализированные модели одноклеточного анализа. Помимо предсказательной способности, архитектура позволила выявить воспроизводимые генные программы, связанные с эффективностью и резистентностью к терапии, что открывает новые возможности для интерпретируемой персонализированной медицины в онкоиммунологии.
В статье представлен SHINE — инновационный вычислительный фреймворк на основе гиперграфов, предназначенный для совместного анализа пространственной экспрессии генов и метаболических сетей. Разработка решает критические проблемы мультиомиксных исследований: пространственное несовпадение данных, разницу в разрешении и сложные взаимодействия между транскриптомом и метаболомом. Методология SHINE использует обучение представлениям (representation learning) для интеграции данных, полученных с одного тканевого среза. В ходе тестирования на моделях болезни Паркинсона у мышей алгоритм успешно выявил области с истощением дофаминергических нейронов и реконструировал оси, связанные с дофамином. При анализе образцов рака легких и молочной железы у человека метод позволил точно сегментировать опухолевые микроокружения и идентифицировать пространственно организованные генно-метаболические программы. Технология демонстрирует высокую масштабируемость и точность в выявлении биомаркеров, что открывает новые возможности для прецизионной диагностики и понимания молекулярных механизмов заболеваний.
В данном исследовании представлен комплексный бенчмарк фундаментальной геномной модели Evo 2 на массиве из 19 429 вирусных геномов из базы RefSeq. Авторы проанализировали способность модели Evo 2 (параметром 20 млрд) улавливать сложную архитектуру вирусных геномов, выходящую за рамки простого нуклеотидного состава. С помощью линейных зондов было установлено, что на оптимальном промежуточном слое модель достигает точности 0.96 в классификации классов по системе Балтимора и 0.99 в определении домена хозяина. Ключевым результатом стало то, что эмбеддинги модели значительно превосходят базовые показатели (6-мерный состав) в декодировании плотности генов (R=0.77), доли кодирующих последовательностей (R=0.61) и перекрытия генов (R=0.64). В задачах генерации фрагментированных геномов модель показала перплексию 1.18 бит/нт для бактериофагов и 1.80 бит/нт для вирусов эукариот. Исследование доказывает, что Evo 2 действительно кодирует функциональную архитектуру вирусных геномов, что открывает новые возможности для биоинформатического анализа и синтетической биологии.
Исследование посвящено изучению генетических профилей экспрессии эндометриоза, которые варьируются в зависимости от анатомического расположения очагов и фазы менструального цикла. Авторы провели масштабный анализ, составив атлас на основе секвенирования РНК единичных клеток (scRNA-seq), охвативший 672 051 клетку от 112 доноров, включая эутопический эндометрий, менструальные выделения, яичники и перитонеальный эндометрий. С помощью машинного обучения были обучены классификаторы, которые позволили выявить подмножество «основных» клеток очага, сохраняющих идентичность маточного эндометрия, но при этом отличающихся от окружающих тканей. Результаты показали, что транскриптомные различия между этими клетками в различных очагах остаются стабильными на всех фазах цикла и даже при приеме гормональной терапии. Выявленные специфические генные сигнатуры позволили успешно классифицировать статус заболевания и подтипы очагов на независимых данных 168 пациентов. Данное открытие закладывает основу для разработки методов диагностики и подтипирования эндометриоза, не зависящих от текущего гормонального фона пациента.
В исследовании анализируется эффективность применения различных алгоритмов машинного обучения для рескоринга совпадений пептид-спектров (PSM) в масс-спектрометрической протеомике. Авторы сравнивают стандартные линейные модели (LSVM) с более сложными нелинейными алгоритмами, такими как Random Forest и XGBoost, доступными в инструменте Mokapot. С помощью метода «ловушки» (entrapment approach) было выявлено, что усложнение моделей приводит к росту числа идентифицированных PSM, однако этот прирост является следствием переобучения и смещения в сторону случайных совпадений с целевой базой данных. В частности, для наиболее сложных моделей фактический уровень ложноположительных результатов (entrapment FDR) достиг 6,3%, в то время как расчетный показатель (decoy FDR) составлял всего 1%. Таким образом, чрезмерная сложность моделей создает иллюзию высокой точности и дает неоправданно оптимистичные оценки FDR. Результаты подчеркивают критическую необходимость баланса между сложностью алгоритма и риском переобучения при автоматизированном анализе протеомных данных.
Исследование посвящено анализу влияния продолженного предобучения (CPT) на специализированную область биологии для крупномасштабных моделей. Ученые протестировали модель Mixture-of-Experts с 26 миллиардами параметров (Gemma-4-26B-A4B), подвергнув её обучению на 8,7 млрд токенов, включающих ДНК, белки и биомедицинские тексты. Результаты показали, что вместо ожидаемого «катастрофического забывания» общих знаний, CPT значительно улучшило показатели: MMLU вырос на 13 пунктов, а точность генерации кода (MBPP) увеличилась с 0,33 до 0,63. В биомедицинской области (BixBench) показатель MCC подскочил с 0,23 до 0,92, что подтверждает глубокую адаптацию модели к научным данным. Единственным негативным эффектом стало снижение правдивости (TruthfulQA на 8,8 пункта), что интерпретируется как доменный дрейф. Авторы доказывают, что CPT и последующая тонкая настройка (SFT) являются взаимодополняющими этапами: CPT расширяет внутренний потенциал модели, а SFT направляет его на конкретные задачи.
Исследование посвящено изучению направленности трансфера знаний между моделями естественного языка (LLM) и биологическими фундаментальными моделями (например, ESM-2, ProtBERT). Авторы проверяют гипотезу о симметричности переноса структурных закономерностей, сравнивая перенос из языка в биологию и наоборот. В ходе экспериментов было установлено, что перенос знаний является асимметричным: языковые модели демонстрируют высокую эффективность при переходе к задачам распознавания гомологии белков (off-domain drop всего 0.08), в то время как биологические модели показывают слабую способность к адаптации под задачи языка (drop 0.36). Исследование показало, что масштабирование моделей не устраняет этот разрыв, а лишь увеличивает его: при росте параметров перенос из языка в биологию усиливается, тогда как обратный процесс стремится к случайным результатам. Результаты работы раскрывают фундаментальную направленность обучения моделей и доказывают, что общие структурные регулярности последовательностей не гарантируют симметричного переноса представлений. Данное открытие критически важно для разработки будущих мультимодальных моделей в биомедицине.