Обзор посвящен развитию систем Med-VQA, которые переходят от простых текстовых баз данных к сложным мультимодальным архитектурам на базе LLM и VLM. Исследование подчеркивает эффективность генеративных моделей, методов RAG и цепочек рассуждений (CoT) в анализе радиологических, патологических и дерматологических изображений.
Исследование представляет новую методику объяснимой диагностики рака кожи, объединяющую сверточные нейронные сети (CNN) для анализа дерматоскопических изображений с визуально-языковыми моделями (VLM) для генерации текстовых пояснений диагноза. Вместо традиционных тепловых карт активации, которые трудно интерпретировать клиницистам, система производит естественные языковые описания выявленных патологий и обоснования диагностических решений. Методология включает обучение на экспертно-аннотированном датасете с разметкой от дерматологов, что обеспечивает высокое качество обучающих данных. Интеграция CNN-VLM позволяет системе не только классифицировать поражения кожи, но и объяснять свои выводы в терминах, понятных врачам. Такой подход решает ключевую проблему внедрения ИИ в клиническую практику — недостаток прозрачности и доверия к решениям «чёрного ящика». Результаты демонстрируют потенциал для улучшения диагностики меланомы и других кожных онкозаболеваний с одновременным повышением объяснимости ИИ-рекомендаций. Работа опубликована в рецензируемом журнале Artificial Intelligence in Medicine, что подтверждает научную ценность исследования.