Leica Biosystems интегрировала два ИИ-продукта от Tempus (Paige PanCancer Detect и Paige Prostate) в свою платформу Aperio AI Store для цифровой патологии. Эти инструменты предназначены для исследований, помогая выявлять подозрительные области при более чем 40 типах рака и оценивать особенности рака простаты на основе гистологических изображений.
В перспективной статье, опубликованной в Nature Machine Intelligence, исследователи Леви и соавторы предлагают новый подход к пониманию внутреннего устройства больших языковых моделей (LLM), фокусируясь на так называемых «токенах рассуждения». Авторы отмечают парадоксальную ситуацию: хотя модели генерируют текстовые цепочки рассуждений, их фактическое решение задачи может отличаться от того, что следует из этого текста. Статья посвящена методологии исследования роли этих промежуточных токенов, которые интерпретируются не просто как текст, а как скрытое состояние модели, влияющее на последующие шаги. Работа направлена на разработку способов анализа того, как именно эти внутренние представления формируют итоговый вывод. Это исследование имеет значение для области объяснимого ИИ (XAI) и безопасности медицинских диагностических систем, где критически важно понимать логику принятия решений алгоритмом. Понимание природы токенов рассуждения позволяет улучшить прозрачность ИИ-ассистентов, используемых в клинической практике, обеспечивая более надежную верификацию их рекомендаций врачами. Статья закладывает теоретическую базу для будущих прикладных исследований в области доверенного искусственного интеллекта.
В статье представлен метод Cell-Lens, который решает проблему потери биологической информации при применении больших языковых моделей (LLM) к данным одиночных клеток (single-cell). Традиционные подходы передают в модель лишь короткий отранжированный список генов, что лишает ИИ контекста, так как значимые маркеры могут выпадать из выборки. Cell-Lens использует обучаемое без дообучения (training-free) структурированное представление клетки в виде типизированных блоков, включающих парные измерения и маркер-подтвержденные программы. Метод был протестирован на четырех бенчмарках (CellVerse, SOAR, CellPuzzles, SC-Arena) с использованием пяти семейств моделей и показал улучшение производительности до 27.1 балла. Особый прирост эффективности наблюдается в случаях, когда ключевой РНК-маркер отсутствует в исходном списке, так как парные белковые данные сохраняют необходимый сигнал. Исследователи также создали и опубликовали бенчмарк CellSpectrum, охватывающий восемь источников и семь задач с парными модальностями, где результаты подтвердили устойчивость улучшений. Работа демонстрирует, что оптимизация входного представления данных позволяет значительно повысить качество рассуждений ИИ в биологии без необходимости переобучения самих моделей.
С ростом объема медицинских исследований ученым становится все сложнее отслеживать новые открытия. Например, число публикаций, связанных с раком, в базе данных PubMed Национальной медицинской библиотеки более чем удвоилось с 2005 года, согласно данным платформы OncoDaily. Чтобы помочь исследователям ориентироваться в этом огромном массиве данных, некоторые федеральные агентства США внедряют функциональность больших языковых моделей (LLM). В частности, Национальный институт рака (NCI) использовал чат-бот, добавленный в приложение Fellows and Young Investigators (FYI), для онбординга новых сотрудников. Чат-бот помогает им быстрее адаптироваться и находить нужную информацию в исследовательской среде. Статья подчеркивает, что LLM становятся важным инструментом для повышения эффективности научной работы, позволяя автоматизировать рутинные задачи поиска и анализа литературы. Это пример практического применения генеративного ИИ в государственных медицинских учреждениях, который может быть масштабирован на другие области здравоохранения. Использование LLM в качестве «со-пилотов» исследователей открывает новые возможности для ускорения научных открытий и улучшения качества медицинских исследований.
Исследователи из ведущих американских университетов — Массачусетского технологического института, Стэнфордского и Колумбийского — провели исследование о влиянии объяснений больших языковых моделей на точность медицинской диагностики у людей без медицинского образования. В работе изучалось, как LLM-генерированные пояснения помогают пользователям диагностировать заболевания кожи и одновременно влияют на уровень доверия к рекомендациям искусственного интеллекта. Результаты показали двойственный эффект: объяснения действительно повышают точность диагностики у непрофессионалов, но одновременно увеличивают склонность безоговорочно доверять ИИ, даже когда алгоритм ошибается. Врачи демонстрируют значительно более критичное отношение — они чаще распознают ошибки алгоритма и реже следуют неверным рекомендациям системы. Исследование подчёркивает важность разработки более прозрачных и надёжных систем объяснимого ИИ для медицинского применения, особенно при использовании непрофессионалами. Работа опубликована в авторитетном рецензируемом журнале Nature Medicine, что подтверждает научную значимость полученных результатов и их потенциальное влияние на регулирование медицинских ИИ-систем.
Исследование демонстрирует применение белковых языковых моделей (pLM) — разновидности ИИ для анализа белковых последовательностей — к метагеномным данным. Авторы показывают, что pLM могут раскрыть функциональный потенциал миллиардов белков из некультивируемых микроорганизмов, когда обучающие данные правильно курированы. Разработана метрика RED (Residue Embedding Diversity) для оценки качества белков, которая работает на порядки дешевле традиционных методов на основе правдоподобия. Обнаружен фундаментальный компромисс между эволюционной калибровкой моделей и структурным моделированием: состав обучающих данных является ключевым фактором, определяющим поведение pLM. Исследователи успешно извлекли разнообразные кандидаты в ферменты из миллиардов метагеномных последовательностей и подтвердили их экспрессию in vivo. Работа имеет значение для открытия новых терапевтических ферментов и понимания микробиома, хотя прямое клиническое применение не демонстрируется.
Статья посвящена вопросам этичного и инклюзивного сбора данных в цифровых исследованиях психического здоровья. Авторы делятся опытом разработки Core Mental Health Dataset (CMHDS), подчеркивая важность учета культурных особенностей и участия людей с соответствующим жизненным опытом для повышения качества данных.
Национальные институты здравоохранения США (NIH) инициировали масштабную программу по стандартизации своих колоссальных массивов биомедицинских данных, накопленных за последние 70 лет. Основная проблема заключается в том, что петабайты информации по таким направлениям, как сердечно-сосудистые заболевания, заболевания легких, расстройства сна и геномика, собирались разными институтами с использованием разрозненных форматов и стандартов. Текущая инициатива направлена на устранение этой фрагментации, что критически важно для создания качественных наборов данных (datasets). Успешная интеграция и приведение данных к единому стандарту позволят значительно ускорить обучение моделей искусственного интеллекта, способных проводить глубокий анализ и ускорять медицинские исследования. Это решение превратит разрозненные архивы в единую экосистему, готовую к применению передовых алгоритмов машинного обучения в биомедицине.
Статья в журнале Nature Machine Intelligence рассматривает критическую проблему подготовки биологических данных для эффективного внедрения алгоритмов искусственного интеллекта. Авторы анализируют концепцию «AI-ready» данных, подчеркивая, что простого накопления информации недостаточно для обучения качественных моделей. В работе выделяются четыре ключевых аспекта, которые должны быть решены для обеспечения совместимости, стандартизации и чистоты биологических наборов данных. Исследование акцентирует внимание на методологических требованиях к метаданным и структурированию информации, что является необходимым условием для масштабируемого применения машинного обучения в биомедицине. Понимание этих принципов позволит ускорить переход от разрозненных лабораторных данных к интегрированным системам поддержки принятия клинических решений. Работа имеет высокую значимость для исследователей, занимающихся разработкой биоинформатических инструментов и систем ИИ в здравоохранении.
Группа российских исследователей, включая специалистов из НИУ ВШЭ (Санкт-Петербург), разработала уникальную открытую базу данных, предназначенную для глубокого изучения механизмов концентрации внимания человека. Проект направлен на создание стандартизированного набора данных, который может быть использован для обучения алгоритмов машинного обучения и разработки систем мониторинга когнитивного состояния. Методология исследования включает сбор и структурирование параметров, характеризующих устойчивость внимания в различных условиях. Данная база данных представляет значительный интерес для разработки ИИ-решений в области нейропсихологии и создания систем адаптивного обучения или контроля усталости. Несмотря на то, что работа носит фундаментальный характер, результаты могут быть применены в создании медицинских инструментов для диагностики когнитивных расстройств и мониторинга состояния пациентов. Открытый доступ к данным способствует ускорению междисциплинарных исследований на стыке ИИ и когнитивистики.
В статье рассматривается инициатива Co-Scientist, направленная на объединение исследовательских мощностей Бостонской детской больницы и лабораторий Массачусетского технологического института (MIT). Основная цель данного сотрудничества заключается в поиске новых методов терапии бокового амиотрофического склероза (БАС) с использованием РНК-технологий. Проект фокусируется на создании инновационных биологических инструментариев для глубокого изучения механизмов заболевания на молекулярном уровне. Использование передовых методов редактирования и манипуляции РНК позволит исследователям разрабатывать более точные и эффективные терапевтические стратегии. Данная инициатива представляет интерес для области биомедицинских технологий и разработки лекарственных средств на основе генетических механизмов.
Компания Calico Life Sciences активно внедряет передовые технологии искусственного интеллекта для ускорения биологических исследований. В частности, компания использует специализированную ИИ-платформу Co-Scientist, предназначенную для интеграции разрозненных научных данных и выявления скрытых закономерностей. Основная цель применения Co-Scientist заключается в соединении разрозненных результатов исследований, которые ранее не рассматривались в едином контексте, для генерации новых перспективных гипотез в области старения. Использование подобных инструментов позволяет значительно сократить время на поиск новых мишеней для терапевтического воздействия. Методология работы ИИ строится на анализе огромных массивов биологической информации, что помогает находить новые связи между молекулярными процессами. Это исследование подчеркивает растущую значимость генеративного ИИ в биомедицинских разработках и его способность трансформировать фундаментальную науку в прикладные решения.
В обзоре рассматривается роль данных реальной клинической практики (RWE) в управлении ревматоидным артритом. Авторы анализируют возможности цифровых технологий и электронных медкарт для дополнения традиционных клинических исследований и улучшения качества жизни пациентов.
Исследование анализирует риски систематических ошибок при создании моделей ИИ для онлайн-диагностики симптомов из-за самоотбора участников. Авторы выявили, что способы привлечения пользователей и процент прохождения повторных опросов существенно влияют на репрезентативность данных, что критично для обучения точных медицинских алгоритмов.
В исследовании проводится сравнительный анализ эффективности трех систем ИИ-агентов (Codex с навыками Claude Scientific Skills, Biomni Lab и DeerFlow 2) при выполнении сложных биоинформатических задач. Основная задача заключалась в поиске и классификации белков, связанных с кальцификацией кокколитофорид, в базе данных UniProt по шести различным механистическим категориям. Результаты показали, что система Codex продемонстрировала наилучший баланс между чувствительностью и специфичностью: 92,4% найденных ею белков имели высокую релевантность, а средний коэффициент сходства Жаккара составил 0,982, что говорит о высокой стабильности. В то же время Biomni Lab выдала самый большой объем данных (8 752 белка), но 69,5% из них оказались малорелевантными из-за чрезмерного расширения поиска на общие семейства белков. DeerFlow 2 показала высокую полноту охвата, но с существенным снижением точности (43,8% низкорелевантных результатов). Исследование делает важный вывод: для биоинформатики качество ИИ-агента определяется не объемом выдачи, а точностью генерации запросов, способностью к декомпозиции промптов и стабильностью результатов при повторных запусках.
Мини-обзор 31 статьи исследует использование одноэлементных мер (SIMs) в цифровых службах психического здоровья для оценки, мониторинга результатов и популяционного надзора. Результаты показывают, что SIMs демонстрируют приемлемую валидность для узко определённых конструктов и ценны для масштабного скрининга и цифровой интеграции, хотя систематическая валидация в различных популяциях необходима.
Систематический обзор с использованием структурного тематического моделирования (STM) анализирует 211 публикаций о технологиях для людей с ограниченными возможностями за 2015-2024 годы. Исследование выявило 6 ключевых тем, включая ИИ-решения для когнитивных и сенсорных нарушений, с акцентом на интерпретацию жестового языка, реабилитацию и цифровые обучающие инструменты.