Исследование выявило критическую проблему в биоинформатическом анализе метагеномных и метатранскриптомных данных: популярные базы данных SSU рРНК (такие как SILVA, GTDB, Eukaryome) содержат значительные примеси последовательностей большой субъединицы (LSU). Это приводит к тому, что риды LSU ошибочно идентифицируются как SSU, что искажает таксономический профиль образцов. В ходе эксперимента на данных метатранскриптома эстуарных отложений было показано, что без очистки баз данных до 50% последовательностей могут быть ошибочно отнесены к ложным доминирующим таксонам. Авторы предлагают два решения: предварительную очистку баз данных или использование тщательно отобранных SSU-специфичных наборов. В рамках работы была представлена обновленная база KSGP 4.0, которая демонстрирует существенное улучшение аннотации архей по сравнению с SILVA, а также умеренные улучшения для бактерий и эукариот. Для автоматизации процесса очистки и аннотации разработан специализированный скрипт total_rnaseq.