Исследователи разработали новую архитектуру глубокого обучения CREAM (Contrastive Regulatory Embeddings Attention Model) для предсказания персонализированной экспрессии генов на основе последовательностей ДНК. Основная проблема, которую решает модель — обучение межиндивидуальных различий, когда вариации последовательности ДНК между людьми минимальны, а экспрессия генов сильно зависит от негенетического шума. Методология включает декомпозицию экспрессии генов на генетические и негенетические компоненты, а также использование контрастных регуляторных эмбеддингов для улавливания тонких различий в последовательностях. Модель была оценена на симулированных данных и транскриптомных наборах данных GTEx, где продемонстрировала значительное превосходство над базовыми архитектурами на обучающих генах и способность автономно приоритизировать статистически точно определённые причинные локусы количественных признаков экспрессии (eQTL). Введение вспомогательного индуктивного смещения L1 дополнительно улучшило локализацию причинных вариантов в невиданных генах. Однако обобщение на предсказание экспрессии невиданных генов остаётся нерешённой проблемой — корреляция падает практически до нуля у всех тестированных методов. Исследование подчёркивает ключевые препятствия в моделировании персонализированной генной регуляции и намечает направления для будущих разработок в области прецизионной медицины.