В статье проводится критический анализ методов машинного обучения для предсказания антидиабетических пептидов (ADP), выявляя существенную проблему «разрыва между происхождением и функцией» (provenance-to-function gap). Авторы демонстрируют, что стандартные бенчмарки часто содержат утечку данных из-за случайного разбиения гомологичных последовательностей, что искусственно завышает точность моделей. При переоценке датасета Basith et al. с учетом гомологии (группировка пептидов по предшественникам) корреляция Мэтьюса (MCC) для моделей падала с 0.92-0.96 до 0.39-0.43 при идентичности последовательностей менее 50%, что указывает на сильную зависимость точности от сходства с обучающей выборкой, а не от реального понимания биологической функции. Исследование охватывает 16 других пептидных бенчмарков, показывая, что проблема утечки гомологии является распространенной: в 11 из 14 тестируемых наборов данные фрагментов одного семейства чаще имеют одинаковую метку, чем случайно. Для решения этой проблемы предложен новый базовый уровень ADP-Hybrid, основанный на ансамбле деревьев решений для каждого слоя классификации. Модель ADP-Hybrid достигла MCC 0.843 на первом слое при скорости вывода в 21-38 раз выше, чем у опубликованных ранее архитектур, и 0.801 на втором слое против 0.858 у конкурентов. Работа подчеркивает необходимость строгого контроля гомологии при оценке ИИ-моделей в биоинформатике и предоставляет открытый протокол и наборы данных для воспроизводимых исследований. Результаты имеют критическое значение для разработчиков алгоритмов предсказания биологических активных молекул, так как показывают, что многие заявленные достижения ИИ могут быть артефактом некорректного разделения данных.