Новость9517 июл.
Исследование оценивает способность LLM извлекать метаданные из медицинских экзаменов по эндокринологии. Результаты показывают, что высокая точность ответов не гарантирует надежности: многие модели демонстрируют высокую вариативность при повторных запусках, что критично для автоматизации оценки.