Компания BSS представила обновление своего программного продукта NLU-Suite версии 3.8, ориентированное на автоматизацию аудита генеративного искусственного интеллекта. Главным нововведением стало внедрение механизмов оценки качества систем RAG (Retrieval-Augmented Generation) с использованием больших языковых моделей (LLM). Данный функционал позволяет автоматизировать проверку точности, релевантности и фактической достоверности ответов, которые генерируют ИИ-агенты на основе предоставленных медицинских или иных баз знаний. Применение LLM-оценки (LLM-as-a-judge) позволяет значительно сократить время на ручную валидацию ответов и снизить риск галлюцинаций нейросетей. В контексте здравоохранения это критически важно для обеспечения безопасности при использовании ИИ в качестве ассистента врача. Обновление NLU-Suite предоставляет разработчикам инструменты для непрерывного мониторинга качества работы сложных интеллектуальных систем в реальном времени.