Исследование посвящено критической проблеме оценки моделей машинного обучения, которые предсказывают изменения клеточных фенотипов при различных биологических воздействиях (возмущениях). Авторы указывают на отсутствие единых стандартов оценки, что делает результаты различных бенчмарков несопоставимыми и тормозит развитие отрасли. В работе представлена новая таксономия, которая классифицирует протоколы оценки по четырем параметрам: репрезентация данных, метрики, трансформация оценок и стратегии отчетности. Для решения проблемы разработчики представили scPertEval — специализированный Python-пакет с эталонными реализациями различных протоколов оценки. С помощью этого инструмента было проведено тестирование на семи общедоступных наборах данных единичных клеток (single-cell datasets), что позволило выявить, как выбор конкретной метрики искажает восприятие качества прогнозов. Работа имеет высокую значимость для биоинформатики и разработки ИИ-инструментов для прецизионной медицины, так как предлагает методологическую базу для создания более точных и сопоставимых моделей прогнозирования ответа клеток на терапию.