Исследование посвящено анализу влияния продолженного предобучения (CPT) на специализированную область биологии для крупномасштабных моделей. Ученые протестировали модель Mixture-of-Experts с 26 миллиардами параметров (Gemma-4-26B-A4B), подвергнув её обучению на 8,7 млрд токенов, включающих ДНК, белки и биомедицинские тексты. Результаты показали, что вместо ожидаемого «катастрофического забывания» общих знаний, CPT значительно улучшило показатели: MMLU вырос на 13 пунктов, а точность генерации кода (MBPP) увеличилась с 0,33 до 0,63. В биомедицинской области (BixBench) показатель MCC подскочил с 0,23 до 0,92, что подтверждает глубокую адаптацию модели к научным данным. Единственным негативным эффектом стало снижение правдивости (TruthfulQA на 8,8 пункта), что интерпретируется как доменный дрейф. Авторы доказывают, что CPT и последующая тонкая настройка (SFT) являются взаимодополняющими этапами: CPT расширяет внутренний потенциал модели, а SFT направляет его на конкретные задачи.