Обзор посвящен развитию систем Med-VQA, которые переходят от простых текстовых баз данных к сложным мультимодальным архитектурам на базе LLM и VLM. Исследование подчеркивает эффективность генеративных моделей, методов RAG и цепочек рассуждений (CoT) в анализе радиологических, патологических и дерматологических изображений.
Исследование оценивает способность восьми различных LLM генерировать вопросы и ответы для медицинских экзаменов на основе реальных данных ЭМК. Результаты показали, что модели (особенно ERNIE 4) могут достигать высокой точности информации, сопоставимой с экспертами, что делает их перспективным инструментом для медицинского обучения.
Пилотное исследование оценивает готовность врачей использовать системы поддержки принятия решений (LLM-CDSS) в гинекологической онкологии. Результаты показывают в целом позитивное, но осторожное отношение: врачи подчеркивают важность прозрачности, клинической валидации и сохранения контроля за человеком.
Исследование посвящено анализу многоагентных систем на базе больших языковых моделей (LLM) в контексте цифрового здравоохранения. Авторы предлагают фреймворк HAMAgent, который использует обратную связь от человека (human-in-the-loop) для улучшения распознавания эмоций и понимания поведения человека.
Исследование оценивает гибридную систему на базе LLM и нейросимволического ИИ для автоматизации документации при лечении возрастной макулярной дегенерации. Система показала точность извлечения данных до 98,3% и сократила время на ведение документации на 88%, значительно снижая административные расходы.
Исследование оценивает способность LLM извлекать метаданные из медицинских экзаменов по эндокринологии. Результаты показывают, что высокая точность ответов не гарантирует надежности: многие модели демонстрируют высокую вариативность при повторных запусках, что критично для автоматизации оценки.
Исследование посвящено анализу влияния продолженного предобучения (CPT) на специализированную область биологии для крупномасштабных моделей. Ученые протестировали модель Mixture-of-Experts с 26 миллиардами параметров (Gemma-4-26B-A4B), подвергнув её обучению на 8,7 млрд токенов, включающих ДНК, белки и биомедицинские тексты. Результаты показали, что вместо ожидаемого «катастрофического забывания» общих знаний, CPT значительно улучшило показатели: MMLU вырос на 13 пунктов, а точность генерации кода (MBPP) увеличилась с 0,33 до 0,63. В биомедицинской области (BixBench) показатель MCC подскочил с 0,23 до 0,92, что подтверждает глубокую адаптацию модели к научным данным. Единственным негативным эффектом стало снижение правдивости (TruthfulQA на 8,8 пункта), что интерпретируется как доменный дрейф. Авторы доказывают, что CPT и последующая тонкая настройка (SFT) являются взаимодополняющими этапами: CPT расширяет внутренний потенциал модели, а SFT направляет его на конкретные задачи.
Группа «Т-Технологии» выпустила в открытый доступ T-Search — специализированную русскоязычную модель, предназначенную для агентного поиска с использованием технологии RAG (Retrieval-Augmented Generation). В отличие от стандартных поисковых систем, T-Search способна выполнять многошаговые запросы, имитируя логику работы ИИ-агента для глубокого анализа данных. Модель оптимизирована для решения сложных бизнес-задач, требующих не просто выдачи ссылок, а синтеза информации из множества источников. Технология позволяет значительно повысить точность извлечения знаний и минимизировать галлюцинации нейросетей при работе с корпоративными базами данных. Это решение представляет интерес для интеграции в медицинские информационные системы и исследовательские платформы, где требуется автоматизированный поиск по научным публикациям или сложным клиническим протоколам. Внедрение подобных агентных моделей может автоматизировать процесс сбора доказательной базы для врачей и аналитиков.
Компания BSS представила обновление своего программного продукта NLU-Suite версии 3.8, ориентированное на автоматизацию аудита генеративного искусственного интеллекта. Главным нововведением стало внедрение механизмов оценки качества систем RAG (Retrieval-Augmented Generation) с использованием больших языковых моделей (LLM). Данный функционал позволяет автоматизировать проверку точности, релевантности и фактической достоверности ответов, которые генерируют ИИ-агенты на основе предоставленных медицинских или иных баз знаний. Применение LLM-оценки (LLM-as-a-judge) позволяет значительно сократить время на ручную валидацию ответов и снизить риск галлюцинаций нейросетей. В контексте здравоохранения это критически важно для обеспечения безопасности при использовании ИИ в качестве ассистента врача. Обновление NLU-Suite предоставляет разработчикам инструменты для непрерывного мониторинга качества работы сложных интеллектуальных систем в реальном времени.
Разработана новая система MMCRAG-Resp, использующая мультимодальный RAG для диагностики респираторных заболеваний на основе звуков, спирометрии и текста. Метод значительно снижает уровень галлюцинаций ИИ и обеспечивает клинически обоснованные, объяснимые ответы с использованием локальных языковых моделей.
В статье исследуются критические уязвимости и вызовы безопасности, возникающие при использовании мультиагентных систем на основе больших языковых моделей (LLM) в различных предметных областях. Авторы выделяют семь ключевых проблем, связанных с взаимодействием агентов, которые могут привести к компрометации данных или некорректному выполнению задач при переходе между доменами. Основное внимание уделяется рискам, возникающим в процессе обмена контекстом и инструментами между специализированными агентами. Исследование подчеркивает необходимость разработки новых протоколов безопасности и методов изоляции для предотвращения несанкционированного доступа и манипуляций в сложных ИИ-экосистемах. Результаты работы имеют важное значение для разработчиков архитектур ИИ, стремящихся к созданию надежных и безопасных автономных систем. Данная работа закладывает теоретическую основу для защиты мультиагентных сред от атак типа 'prompt injection' и междоменных утечек.
Исследователи представили PHI-Reason — инновационный фреймворк для прогнозирования взаимодействий между бактериофагами и их хозяевами (PHI) на уровне видов. В отличие от традиционных методов, использующих числовые векторы сходства последовательностей или состава геномов, PHI-Reason переформулирует задачу как процесс логического вывода на основе биологических текстов. Система преобразует гетерогенные данные (геномы фагов и хозяев, функциональные аннотации, результаты гомологического поиска и метаданные) в модульные текстовые профили. Затем замороженная большая языковая модель (LLM) ранжирует потенциальных хозяев, интегрируя эти доказательства непосредственно во время инференса. Тестирование на бенчмарках показало, что PHI-Reason демонстрирует конкурентоспособную точность и находит правильные соответствия, которые упускают классические методы. Ключевым преимуществом является интерпретируемость: метод позволяет анализировать, на каких именно биологических фактах основан прогноз, и измерять риск галлюцинаций ИИ при неполных данных. Это делает технологию важным инструментом для микробиомной инженерии и глубокого понимания микробной экологии.
В исследовании представлен CAREPath — инновационный фреймворк на базе архитектуры KG-LLM (Knowledge Graph + Large Language Model), предназначенный для поиска новых терапевтических применений существующих лекарственных средств. Авторы решают проблему неэффективности глубокого обхода биомедицинских графов знаний, когда длинные пути через «гены-хабы» создают избыточный шум. Методология сочетает в себе два подхода: DFS-подобный модуль для извлечения коротких, семантически значимых путей «болезнь-ген-препарат» и BFS-подобный модуль для обогащения контекста через соседства генов и фармакологическое сходство. В ходе экспериментов на пяти биомедицинских графах знаний CAREPath превзошел 18 базовых моделей, показав прирост метрики AUPRC до 3,8%. Результаты подтверждают, что кодирование семантических коротких путей является ключевым фактором успеха, а механизм аугментации контекста повышает устойчивость модели при дефиците данных. Практическая значимость подтверждена кейс-стади и сопоставлением с недавно одобренными FDA показаниями, что делает систему интерпретируемым инструментом для разработки новых стратегий лечения.
Исследование, опубликованное в Nature Machine Intelligence, рассматривает проблему гетерогенности психиатрических расстройств и сложности интерпретации неструктурированных лонгитюдных данных, что часто ведет к вариативности в клинической практике. Ученые представили специализированную большую языковую модель (LLM), разработанную именно для нужд психиатрии, которая призвана помочь врачам в стандартизации процесса диагностики и лечения. Методология исследования фокусируется на анализе текстовых нарративов пациентов, которые традиционно сложно поддаются автоматизированной обработке. Ключевым результатом является демонстрация того, что использование данной LLM позволяет снизить субъективность оценок и обеспечить более последовательное, высококачественное оказание медицинской помощи. Внедрение подобных ИИ-инструментов может значительно повысить точность интерпретации динамики состояния пациента во времени. Данная разработка имеет критическое значение для цифровой трансформации психиатрической помощи и внедрения доказательных стандартов в клиническую практику.
В исследовании, опубликованном в журнале npj Digital Medicine, оценивается потенциал использования больших языковых моделей (LLM) для оптимизации процесса получения информированного согласия от пациентов в рамках клинических испытаний. Авторы анализировали способность ИИ интерпретировать сложные медицинские протоколы и преобразовывать их в доступный для пациентов формат, сохраняя при этом юридическую и клиническую точность. Методология включала сравнение ответов LLM с ответами медицинских экспертов на вопросы участников исследования. Результаты показали, что современные модели способны демонстрировать высокую степень соответствия стандартам информированного согласия, значительно сокращая время на разъяснение процедур. Применение ИИ в этом аспекте может снизить когнитивную нагрузку на пациентов и минимизировать риск ошибок при интерпретации условий участия. Данная работа подчеркивает важный шаг в автоматизации административных и коммуникационных процессов в клинической практике с помощью генеративного ИИ.
В данной статье представлены результаты рандомизированного контролируемого исследования (RCT), направленного на изучение эффективности функции Guided Learning на базе модели Gemini. Исследование проводилось в Сьерра-Леоне с целью оценки того, как персонализированное ИИ-обучение влияет на вовлеченность и скорость усвоения знаний учащимися. Основной акцент сделан на потенциале использования больших языковых моделей для преодоления образовательных барьеров в развивающихся регионах. Результаты демонстрируют, что внедрение инструментов Guided Learning способствует значительному росту вовлеченности студентов в учебный процесс. Методология RCT позволяет подтвердить прямую корреляцию между использованием ИИ-ассистента и ускорением темпов обучения. Данная работа имеет важное значение для понимания того, как ИИ может масштабировать качественное образование и поддерживать когнитивное развитие в условиях ограниченных ресурсов.
В статье рассматривается критическая проблема современного медицинского ИИ: разрыв между высокой производительностью моделей и их клинической обоснованностью. Авторы утверждают, что текущие методы объяснимого ИИ (XAI) и post-hoc интерпретации недостаточны для преодоления эпистемического разрыва между поведением алгоритма и обоснованными медицинскими заключениями. Вместо акцента на интерпретируемость, исследователи предлагают переход к модели управления на основе проверяемости (testability). Основные рекомендации включают проведение пререгистрированных эмпирических испытаний для проверки причинно-следственного соответствия и устойчивости моделей к изменениям оборудования (сканеров), локаций и подгрупп пациентов. Также предлагается концепция «Институционального ИИ», которая подразумевает обязательный аудит происхождения данных, проспективную валидацию, внешние проверки и использование состязательных (adversarial) методов оценки для больших языковых моделей (LLM). Данный подход направлен на минимизацию использования алгоритмами «коротких путей» (shortcuts) и обеспечение безопасности клинического применения.
Исследование оценивает способность ведущих LLM (включая Gemini и Grok) отвечать на вопросы пациентов о заболеваниях сердца. Результаты показали высокую точность и низкий уровень галлюцинаций, при этом Gemini была признана наиболее качественной моделью по совокупности факторов.
Исследование изучает использование LLM (таких как ChatGPT) среди студентов и преподавателей стоматологической школы UTHealth. Результаты показывают высокий уровень использования инструментов для обучения и письма, при этом преподаватели выражают острую потребность в специализированном обучении работе с ИИ.
Систематический обзор демонстрирует стремительный рост использования ИИ в обучении студентов-медиков, особенно через виртуальных пациентов на базе LLM. Основные направления включают симуляцию клинического мышления, оценку навыков OSCE и обучение работе с электронными медицинскими картами.