В исследовании оценивается способность агентов на основе больших языковых моделей (LLM) выполнять две различные задачи в биоинформатике: оркестровку рабочих процессов и биологическую интерпретацию данных. Для этого была разработана система Genome Skeptic, где детерминированные инструменты генерируют измерения последовательностей, а ИИ-контроллер запрашивает дополнительные анализы только из заранее определенного реестра. В проспективном слепом когорте из 20 геномов модель GPT-5.6 Sol, действовавшая как контролер рабочего процесса, достигла точности 18 из 20 правильных ответов, что сопоставимо с фиксированными стратегиями, но потребовала на 32-47% меньше дополнительных анализов. Однако когда та же модель получила полномочия окончательного решения о состоянии доказательств, точность упала до 11 из 20, специфичность снизилась с 1.00 до 0.30, а модель не смогла исправить ошибки детерминированного анализатора. Все девять расхождений в конечных точках привели к переходу от отрицательных вызовов к неразрешенным, а не к выявлению пропущенных положительных случаев. Исследование демонстрирует, что LLM эффективны в управлении последовательностью действий, но ненадежны в биологической интерпретации результатов, что критически важно для разработки безопасных ИИ-систем в геномике.