Статья представляет метод гармонизации клинических данных с использованием онтологий и больших языковых моделей (LLM) для федеративного обучения в здравоохранении. Подход достигает 92% согласованности с экспертной оценкой, преобразуя гетерогенные клинические записи в стандартизированные форматы с сохранением конфиденциальности данных.
Исследователи разработали автоматизированный программный инструмент для курации данных в геномике, который заменяет ручной труд человека при аннотировании транскриптомных исследований. Система используется для ресурса Gemma — вручную курируемой базы данных, включающей более 23 000 наборов данных человека, мыши и крысы, преимущественно из Gene Expression Omnibus (GEO). Пайплайн сочетает традиционные механические методы и большие языковые модели для создания детальных аннотаций на уровне образцов и экспериментов с привязкой к онтологиям. Бенчмаркинг показал, что производительность системы близка к уровню человеческих кураторов, при этом стоимость снижена в 20 раз, а скорость увеличена минимум в 100 раз. Авторы также представили предварительные методы триажа для выявления ошибок в автоматических курациях с последующей передачей на человеческую проверку. В качестве дополнительных результатов предоставлены бенчмарк-набор из 500 исследований и框架 оценки для дальнейшего развития пайплайна. Данное решение имеет значительный потенциал для интеграции в биоинформатические экосистемы и ускорения медицинских исследований на основе геномных данных.
Исследователи представили HARMONY — инновационную платформу и фреймворк, предназначенный для решения проблемы разрозненности метаданных в крупнейших метаболомных базах данных, таких как Metabolomics Workbench и MetaboLights. Система использует онтологический подход для гармонизации девяти ключевых узлов данных, включая биологические параметры (вид, источник образца, заболевание) и аналитические характеристики (метод разделения, тип ионизации, масс-анализатор), а также сопоставляет метаболиты с единым стандартом RefMet. Методология включает двухэтапный рабочий процесс: многоисточниковое извлечение данных и последующее онтологическое картирование, которое преобразует специфические термины репозиториев в общие поисковые запросы. Результаты внедрения показали значительный рост эффективности: кросс-репозиторная доступность данных увеличилась с 75,5% до 89,6%. При этом около 91% исследований из Metabolomics Workbench и 85% из MetaboLights достигли высокого уровня гармонизации (минимум шесть из восьми узлов). Платформа, доступная по адресу omicsinharmony.in, использует ML-энкодеры для создания общих представлений метаданных, что позволяет проводить глубокий поиск и сравнение исследований на уровне метаболитов, значительно упрощая повторное использование данных в биомедицинских исследованиях.
Статья представляет онтологически-ориентированный фреймворк для интеграции медицинских данных (клинических, пациентских, геномных) в электронные медицинские карты. Framework обеспечивает семантическую интероперабельность и согласованность с медицинскими стандартами (HL7 FHIR, SNOMED CT, LOINC). Концептуально продвигает развитие систем здравоохранения для улучшения качества помощи.