Исследование сравнивает две современные модели (TriG-NER и DocDiscNER) для распознавания сложных, фрагментированных медицинских терминов. Результаты показывают, что генеративные модели лучше справляются с длинными документами, в то время как графовые архитектуры эффективнее на уровне предложений.
В статье исследуется применение трансформерных моделей для генерации синтетических медицинских табличных данных (SDG), что позволяет обходить ограничения доступа к реальным клиническим данным, сохраняя их структурную сложность и мультимодальные распределения. Авторы сравнивают три режима обучения в контексте (in-context learning): zero-shot, one-shot и few-shot, используя небольшие модели Llama 3.2 (1B и 3B параметров) и Phi (1.3B и 2.7B параметров) на реальном клиническом наборе данных. Ключевым результатом стало выявление компромисса между точностью и конфиденциальностью: режим zero-shot продемонстрировал более высокую верность (fidelity) данным и меньшую склонность к галлюцинациям по сравнению с методами с примерами, однако он оказался менее эффективным в защите приватности. Исследование показало, что размер модели и её семейство не оказывают существенного влияния на качество генерации в рамках сравниваемых подходов. Работа вносит вклад в понимание оптимизации адаптации трансформеров к табличным медицинским данным, предлагая эмпирические доказательства эффективности zero-shot подходов для повышения достоверности синтетических наборов. Результаты указывают на необходимость дальнейших исследований по снижению галлюцинаций и расширению анализа на другие архитектуры и датасеты для практического внедрения в медицинские исследования.
Статья обсуждает проблему работы с некачественными данными при внедрении генеративного ИИ, подчеркивая, что современные LLM способны справляться с хаосом в записях. В качестве примера приводится кейс в медицинском секторе, где ИИ помог автоматизировать сверку медицинских счетов из разнородных источников (PDF, изображения).
Статья поднимает критически важный вопрос о том, как медицинские учреждения могут справедливо участвовать в ценности, создаваемой их данными и экспертизой для коммерческих ИИ-инструментов. Авторы отмечают, что именно клинические данные, рабочие процессы больниц и профессиональный опыт клиницистов являются ключевыми факторами, определяющими эффективность и рыночную стоимость ИИ-продуктов вендоров. Основная дилемма заключается в поиске баланса между коммерческой выгодой для больниц и защитой пациентов от новых форм ответственности. Статья рассматривает вопросы владения данными, распределения прибыли и потенциальных юридических рисков при создании ИИ-решений на основе медицинской информации. Проблема актуальна в контексте растущего внедрения машинного обучения в здравоохранении и необходимости формирования новых регуляторных рамок. Материал относится к категории отраслевых мнений, а не к исследованиям или продуктовым анонсам, что важно учитывать при оценке его практической ценности. Статья публикуется на портале Fierce Healthcare, который специализируется на новостях здравоохранения и медицинских технологий.
Статья обсуждает новые рекомендации FDA, ослабляющие надзор за медицинскими ИИ-продуктами, и проблему недостаточной представленности женщин в данных для обучения медицинских моделей. Автор подчеркивает, что ИИ может помочь исправить гендерные предвзятости в диагностике, но только при использовании инклюзивных данных.
Исследование рассматривает перспективы 19 экспертов, работающих с федеративными сетями для обмена медицинскими данными, фокусируясь на правовых и практических аспектах защиты данных в рамках GDPR и EHDS. Результаты показывают, что хотя федеративный подход имеет преимущества, такие как минимизация данных, существуют значительные трудности в соответствии с требованиями защиты данных.