В данном исследовании оценивается способность больших языковых моделей (LLM), в частности ChatGPT-4o и Gemini 3 Pro, точно оценивать транскрибированные симулированные взаимодействия между стандартизированными пациентами и студентами-медиками, а также генерировать полезную нарративную обратную связь. Исследование проводилось в рамках одного центра с участием 12 пар «врач-пациент», где оценки LLM сравнивались с оценками врача-рецензента, использующего золотой стандарт рубрики, включающей 55 элементов сбора анамнеза и 19 элементов презентации случая для оценки диагностического мышления, планирования лечения и консультирования пациентов. Результаты показали высокую степень согласия между LLM и врачом при оценке элементов сбора анамнеза (коэффициент каппы Коэна κ = 0,84–0,89; внутриклассовые коэффициенты корреляции ICC = 0,93–0,97), тогда как согласие при оценке презентации случая было умеренным (κ = 0,62–0,72; ICC = 0,61–0,83). Обе модели сгенерировали подробную, точную и клинически полезную нарративную обратную связь, которая была дополнительно оценена независимыми экспертами. Авторы делают вывод, что LLM могут надежно оценивать симулированные взаимодействия врач-пациент, что открывает возможности для стандартизированной оценки клинической коммуникации в исследовательских целях, улучшении качества медицинской помощи и медицинском образовании. Это исследование демонстрирует практическую применимость ИИ для автоматизации сложного процесса оценки коммуникативных навыков медицинских работников, снижая субъективность и временные затраты на ручную оценку.