В данном исследовании проводится сравнительная оценка эффективности трех больших языковых моделей (LLM) — Claude-Sonnet-4.6, Grok-4 и ChatGPT-5 — в задачах пренатальной диагностики по сравнению с двумя врачами-клиницистами. Для оценки использовался набор из 125 вопросов, взятых из национального стандартизированного квалификационного экзамена по пренатальному ультразвуковому скринингу в Китае. Исследование показало, что общая точность ответов не имела статистически значимых различий между моделями и врачами: главный врач набрал 89,60% (112/125), Claude-Sonnet-4.6 — 85,60% (107/125), Grok-4 — 84,80% (106/125), ChatGPT-5 — 84,00% (105/125), а врач-ординатор — 80,00% (100/125). Однако при детализации по типам вопросов выявились существенные различия: в задачах на основе клинических случаев (n=20) главный врач значительно превзошел все модели (95,00% против 70,00% у лучшей модели, Grok-4), что указывает на пробелы в сложном клиническом рассуждении у ИИ. В последовательных наборах вопросов Grok-4 (95,74%) и главный врач (93,62%) показали лучшие результаты по сравнению с врачом-ординатором (76,60%). Авторы приходят к выводу, что современные LLM могут служить мощными инструментами для расширения знаний, но пока не готовы к автономному выполнению роли клинического рассудителя в такой сложной и этически значимой области, как пренатальная диагностика.