В статье представлена новая методология оценки OCTAVE (Octave-scale Evaluation), предназначенная для более точной проверки моделей искусственного интеллекта, предсказывающих пространственную экспрессию генов на основе гистологических изображений. Авторы критикуют стандартный метрический подход, основанный на среднем коэффициенте корреляции Пирсона (PCC) по генам, указывая на его неспособность различать пространственные масштабы: модель может получать высокие баллы просто за улавливание крупной организации ткани, игнорируя мелкомасштабные детали. Для демонстрации этой проблемы используется концепция «доменного оракула», который показывает, что даже простые статистические предсказания на основе разбиения ткани достигают 82–123% от результата сложных обучаемых моделей при стандартном разрешении (~100 мкм). Методология OCTAVE решает эту проблему, разделяя предсказания и измерения на пространственные полосы шириной в микрометры и оценивая их соответствие на каждом отдельном масштабе. Анализ данных Xenium с разрешением 16 мкм выявил, что на мелких масштабах (~20 мкм) недостатки моделей становятся значительно более очевидными, чем это видно через призму PCC, а оракул отстает от обученной модели в 2,4 раза больше, чем по среднему PCC. Исследование охватило 57 различных кодировщиков изображений и показало, что finest band (самый мелкий масштаб) меняет рейтинг 261 пары из 1596 по сравнению со стандартной метрикой, что доказывает несостоятельность текущих бенчмарков шириной 50 мкм для валидации тонкой структуры. Внедрение OCTAVE позволяет напрямую валидировать способность ИИ-моделей предсказывать экспрессию генов на конкретных пространственных масштабах, что критически важно для развития точной цифровой патологии и пространственной транскриптомики.