В исследовании, опубликованном в журнале npj Digital Medicine 29 сентября 2026 года, представлена новая архитектура зрительно-языкового моделирования (vision-language modeling) для анализа компьютерной томографии (КТ). Авторы разработали метод, способный обобщать знания на популяционном уровне, позволяя не только диагностировать конкретные патологии, но и прогнозировать риски развития различных заболеваний на основе визуальных данных КТ. Методология включает обучение нейросетей на больших наборах данных, объединяющих медицинские изображения и текстовые описания, что позволяет модели понимать сложные клинические контексты и выявлять скрытые корреляции между анатомическими изменениями и системными рисками. Ключевые результаты демонстрируют высокую точность предсказаний в задачах стратификации пациентов по группам риска, превосходя традиционные подходы, основанные только на визуальной диагностике. Значимость работы заключается в возможности интеграции таких моделей в клиническую практику для превентивной медицины и персонализированного подхода к лечению, что особенно важно для управления здоровьем больших популяций. Исследование закладывает основу для создания универсальных ИИ-систем, способных адаптироваться к различным клиническим сценариям без необходимости переобучения для каждой отдельной задачи.