Статья посвящена критическому анализу текущих методов оценки качества работы ИИ-ассистентов (ambient scribes), которые используются для автоматического ведения медицинских записей. Исследователи из компании Suki утверждают, что общепринятые в индустрии протоколы проверки клинических заметок, созданных искусственным интеллектом, являются фундаментально ошибочными и не способны выявлять серьезные ошибки в данных пациентов. В работе подчеркивается, что существующие метрики могут пропускать критические неточности, что создает риски для безопасности пациентов и точности медицинских карт. Авторы призывают к пересмотру методологии тестирования ИИ-решений в здравоохранении, предлагая более строгие и клинически ориентированные подходы к валидации. Это исследование имеет ключевое значение для разработчиков медицинского ПО и клиник, внедряющих технологии автоматизации документации. Переход к новым стандартам оценки позволит минимизировать риск медицинских ошибок, вызванных галлюцинациями или неверной интерпретацией речи врача нейросетями.