Исследование представляет TEDlm — новый класс языковых моделей белков, которые обучаются на сегментах структурно определенных доменов, а не на полноразмерных последовательностях. В отличие от стандартных моделей (например, ESM2), TEDlm фокусируется на очищенных сигналах фолдов, исключая линкеры и неупорядоченные области. Авторы предложили вариант TEDlm3D, использующий функцию потерь на основе контактов (C distance-guided contact loss) для супервизии карт внимания. В тестах на обнаружение удаленного гомологичного сходства (CATH S40, <40% идентичности) модель TEDlm с 650 млн параметров показала AUROC 0.28, что превосходит 3-миллиардную ESM2 (0.22), а версия TEDlm3D достигла AUROC 0.50, вплотную приблизившись к результатам структурного инструмента Foldseek (0.53). Кроме того, TEDlm демонстрирует значительное улучшение в zero-shot предсказании молекулярных функций и сохраняет высокую точность в задачах биофизических свойств. Результаты доказывают, что доменно-ориентированное предобучение позволяет создавать компактные и структурно информированные модели, эффективные для биоинформатики и разработки лекарств.