В исследовании, опубликованном в журнале npj Digital Medicine 25 сентября 2026 года, рассматривается применение больших языковых моделей (LLM) в роли автоматизированных судей для оценки качества ответов клинических генеративных систем искусственного интеллекта. Авторы анализируют эффективность использования LLM для сравнения и верификации выводов других медицинских ИИ-моделей, что позволяет значительно ускорить процесс валидации и снизить нагрузку на экспертов-людей. Методология включает сравнение оценок, выставленных языковыми моделями, с мнениями квалифицированных медицинских специалистов, демонстрируя высокую корреляцию между автоматизированной и ручной оценкой. Ключевые результаты показывают, что LLM способны надежно выявлять неточности, галлюцинации и несоответствия клиническим рекомендациям в ответах генеративных моделей, обеспечивая масштабируемый инструмент контроля качества. Данное исследование имеет важное значение для развития стандартов в области медицинского ИИ, так как предлагает решение проблемы дефицита времени экспертов при массовом тестировании новых алгоритмов. Внедрение таких систем оценки может способствовать более быстрому внедрению безопасных и эффективных клинических ИИ-решений в практику здравоохранения. Работа подчеркивает необходимость дальнейшей разработки протоколов для обеспечения надежности LLM-судей в критически важных медицинских сценариях.