Статья посвящена актуальной проблеме внедрения больших языковых моделей (LLM) в клиническую практику. Основное внимание уделено вопросу доверия врачей к ИИ-чат-ботам и методологии оценки их безопасности и точности. Разработчики медицинских ИИ-инструментов заявляют, что существующие подходы к бенчмаркингу имеют серьёзные недостатки и не отражают реальные клинические условия. Поднимается проблема конкуренции между различными LLM за внимание медицинского сообщества. Статья исследует напряжённость между быстрым внедрением технологий и необходимостью доказательной валидации. Особый акцент сделан на том, что текущие стандарты оценки могут не соответствовать специфике медицинских задач. Материал важен для понимания барьеров на пути интеграции ИИ в здравоохранение и необходимости разработки более релевантных метрик оценки.