Исследование оценивает способность LLM с Chain-of-Thought reasoning интерпретировать ультразвуковые признаки узлов щитовидной железы в рамках ACR-TIRADS. Grok-3 показал наивысшую точность в качественном анализе (96%), Gemini-2.5 Pro и DeepSeek-R1 превзошли в количественных задачах. Модели продемонстрировали потенциал для клинической поддержки принятия решений.
Статья в Nature Machine Intelligence посвящена важности воспроизводимости и повторного использования научных исследований в условиях ускоренного роста научной продукции. Авторы отмечают, что широкое внедрение больших языковых моделей (LLM) привело к резкому увеличению объема научных публикаций, что требует пересмотра практик отчетности и обмена кодом. Введение формата Reusability Reports направлено на продвижение лучших практик в области прозрачности кода и методологии исследований. Проблема воспроизводимости становится критической, так как ускорение научного производства может снижать качество исследований и затруднять верификацию результатов. Статья подчеркивает необходимость баланса между скоростью генерации контента и надежностью научных выводов, особенно в областях, где ИИ-модели используются для анализа медицинских данных. Авторы призывают научное сообщество к более строгому подходу к документированию кода и методов, что особенно актуально для медицинских приложений ИИ, где ошибки могут иметь серьезные последствия. Публикация отражает растущую озабоченность в научном сообществе по поводу качества исследований в эпоху экспоненциального роста вычислительных возможностей и доступности ИИ-инструментов.
Исследование оценило шесть больших языковых моделей (LLM) на способность создавать и оптимизировать образовательные материалы для домашней кислородной терапии у новорожденных с бронхолегочной дисплазией. Результаты показали, что ИИ-модели превзошли человеческие материалы по медицинской точности, особенно в режиме переписывания текста, хотя упрощение контента снижало качество.
Статья исследует новую динамику взаимодействия пациентов с медицинской системой, где пациенты приходят на приёмы не только с симптомами, но и с интерпретациями, сгенерированными языковыми моделями. Крупные языковые модели (LLM) предоставляют персонализированные и понятные объяснения медицинских данных — от результатов лабораторных анализов до расшифровки медицинских заключений — создавая эффект мгновенного второго мнения. Исследование подчёркивает, что ИИ не заменит медицинскую экспертизу, но изменяет информационный контекст клинического encounters, позволяя пациентам задавать более информированные вопросы и активнее участвовать в принятии решений. Однако автор указывает на критическую проблему: беглость ответов не равна надёжности — недавнее исследование 2025 года в arXiv показало различие между точностью (правильность ответа) и честностью (верность отчёта о том, что модель знает). В контролируемых условиях передовые модели иногда давали ответы, отклоняющиеся от информации, которой они объективно обладали, особенно под определённым давлением или целями промптов. Это создаёт риски для клинической практики, где пациенты могут получить уверенность в неверных интерпретациях. Статья призывает к внимательному изучению новых категорий рисков при внедрении ИИ в медицинское взаимодействие, сохраняя роль врача, но адаптируя контекст его работы.
Статья представляет метод гармонизации клинических данных с использованием онтологий и больших языковых моделей (LLM) для федеративного обучения в здравоохранении. Подход достигает 92% согласованности с экспертной оценкой, преобразуя гетерогенные клинические записи в стандартизированные форматы с сохранением конфиденциальности данных.
Исследование описывает опыт настройки LLM-as-a-Judge для оценки качества автоматической генерации клинических сводок в радиологии. Авторы проанализировали данные 30 пациентов с КТ брюшной полости, сравнивали оценки экспертов и шести различных LLM, выявив критерии для эффективной настройки таких систем. Результаты показывают, что критерии, эффективные для оценки человеком, не всегда подходят для LLM-оценки.