Исследование демонстрирует способность модели LLaMA 3.3 70B извлекать прогностическую информацию из текстовых патоморфологических отчетов для оценки выживаемости при раке ЖКТ. Разработанный метод позволяет преобразовывать неструктурированный текст в бинарный биомаркер риска, который является независимым прогностическим фактором.
В статье исследуется инновационный подход к оценке качества больших языковых моделей (LLM) в медицине с использованием методов компьютерного адаптивного тестирования (CAT). Традиционные методы бенчмаркинга требуют огромных вычислительных ресурсов и затрат, тогдая предложенная методология позволяет значительно оптимизировать процесс проверки медицинских знаний ИИ. Исследование фокусируется на том, как алгоритмы адаптивного тестирования могут динамически подбирать сложность вопросов в зависимости от ответов модели, что сокращает количество необходимых тестов без потери точности оценки. Основной результат заключается в возможности достижения сопоставимой точности оценки при существенно меньших затратах на токены и время. Данный подход имеет критическое значение для быстрой итерации медицинских ИИ-систем и их регулярного аудита на соответствие клиническим стандартам. Внедрение CAT в процесс валидации LLM может стать новым стандартом в индустрии разработки медицинского искусственного интеллекта.
В статье представлен elab2ARC — инновационный браузерный инструмент, предназначенный для автоматизации процесса преобразования записей из электронных лабораторных журналов (ELN) в стандартизированные исследовательские объекты. Основная проблема, которую решает разработка, заключается в низкой машиночитаемости форматов ELN, что требует от ученых значительных трудозатрат на ручную переработку данных для публикаций. Система использует API платформы eLabFTW для извлечения метаданных, протоколов и вложений, организуя их в таблицы, соответствующие стандарту ISA (Investigation, Study, Assay). Важной особенностью является внедрение опционального рабочего процесса с использованием больших языковых моделей (LLM) для извлечения структурированных метаданных из неструктурированного свободного текста протоколов. Все вычисления происходят на стороне клиента, что гарантирует полный контроль пользователя над данными перед их отправкой в репозиторий PLANTdataHUB. Инструмент позволяет интегрировать принципы FAIR (находимость, доступность, совместимость и повторное использование) в повседневную лабораторную практику без нарушения текущих рабочих процессов. Это обеспечивает эффективный путь к долгосрочному архивированию и публикации результатов биомедицинских исследований.
Системный интегратор «Платформикс» реализовал проект по созданию специализированного высокопроизводительного вычислительного кластера для нужд компании «Северсталь». Данная инфраструктура предназначена для развертывания и эффективного обучения моделей генеративного искусственного интеллекта внутри корпоративного контура заказчика. В рамках проекта была спроектирована сложная архитектура, учитывающая высокие требования к пропускной способности сети и вычислительной мощности GPU. Внедрение собственного кластера позволяет «Северстали» ускорить процессы разработки ИИ-решений и обеспечить безопасность данных при работе с LLM. Использование подобных мощностей критически важно для автоматизации сложных производственных процессов и оптимизации управления ресурсами через ИИ. Проект демонстрирует переход крупных промышленных игроков к созданию собственной суверенной ИИ-инфраструктуры.
Российская ИТ-компания «Салют для бизнеса» (входящая в экосистему Сбера) совместно с крупными игроками, такими как «ФосАгро» и Global ERP, инициирует масштабное внедрение технологий генеративного искусственного интеллекта в промышленный сектор. Основная цель проекта заключается в интеграции продвинутых LLM-моделей в корпоративные платформы для оптимизации бизнес-процессов и повышения операционной эффективности предприятий. В рамках инициативы планируется использование ИИ для автоматизации обработки документации, поддержки принятия управленческих решений и улучшения взаимодействия с сотрудниками через интеллектуальных ассистентов. Проект ориентирован на создание адаптивных систем, способных работать с отраслевой спецификой крупных промышленных холдингов. Реализация данных технологий позволит сократить временные затраты на рутинные операции и повысить точность анализа больших массивов корпоративных данных. Это важный шаг в цифровой трансформации российского промышленного сектора с использованием отечественных ИИ-решений.
Системный интегратор «Платформикс» завершил проект по созданию специализированной высокопроизводительной инфраструктуры для компании «Северсталь». Основная цель проекта — развертывание физического вычислительного кластера, оптимизированного для работы с большими языковыми моделями (LLM) и генеративным искусственным интеллектом. Разработанная архитектура обеспечивает необходимые вычислительные мощности для интеграции ИИ-инструментов непосредственно в производственные и бизнес-процессы металлургического гиганта. Создание такой технологической базы позволяет компании масштабировать использование нейросетевых решений внутри собственного контура, обеспечивая высокую скорость обработки данных. Проект закладывает фундамент для цифровой трансформации предприятия через внедрение продвинутых алгоритмов машинного обучения. Данное решение подчеркивает растущий тренд на создание локальной инфраструктуры для поддержки тяжелых ИИ-нагрузок в крупном промышленном секторе.
Медицинская система Hartford HealthCare совместно с технологической компанией K Health представила инновационный инструмент PatientGPT, предназначенный для улучшения взаимодействия пациентов с медицинской информацией. Данный сервис на базе искусственного интеллекта позволяет пользователям задавать сложные вопросы о своем здоровье, получать разъяснения по медицинским терминам и, что особенно важно, выявлять потенциальные взаимодействия между лекарственными препаратами. На текущем этапе внедрение технологии ограничено пилотным запуском для определенной группы взрослых пациентов внутри системы Hartford HealthCare. Инструмент призван снизить когнитивную нагрузку на пациентов и предоставить им более персонализированный и доступный доступ к знаниям в режиме реального времени. Использование LLM (больших языковых моделей) в данном контексте демонстрирует переход от классических справочников к интерактивным ИИ-ассистентам в рамках первичного звена здравоохранения.
Исследование посвящено проверке возможности использования бесплатных локальных моделей с открытыми весами для выполнения роли «агентов» в биомедицинских лабораториях. Авторы решают проблему высокой стоимости использования передовых моделей (frontier models) при выполнении рутинных задач анализа данных. В методологии исследования использовалась модель Claude Opus для создания детальных планов по поиску вариантов (variant calling), которые затем выполнялись шестью новейшими открытыми моделями 2026 года выпуска. Результаты показали, что модель qwen3.6:27b полностью воспроизвела точность передовых моделей на каждом этапе и показала идентичные результаты с Opus в матрице ошибок из 36 ячеек. Важным практическим выводом является то, что для работы таких агентных систем достаточно оборудования стоимостью менее 2000 долларов, например, Jetson или Mac Mini. Исследователи предоставили открытый фреймворк, включая планы, код для оценки и артефакты, что позволяет лабораториям самостоятельно тестировать новые модели по мере их выхода.
Исследование посвящено фундаментальной проблеме создания искусственной агентности через внедрение термодинамических ограничений в большие языковые модели (LLM). Авторы предлагают метаболическую модель, где генерация токенов ограничена конечным энергетическим бюджетом, имитирующим биологическую потребность в самосохранении. В ходе экспериментов на базе модели Qwen2.5-1.5B было установлено, что наличие интероцептивной обратной связи позволяет модели поддерживать функциональную самограничность и продлевать «выживание» с 20 до более чем 31 шага. Важным результатом стало обнаружение того, что временная структура шума влияет на устойчивость системы сильнее, чем его амплитуда (OU-шум показал 20.5 шагов против 8.6 у белого шума). Также выявлен порог сжатия на уровне ~3.2 нат и доказано, что обратная связь помогает модели поддерживать экономию ресурсов, снижая наклон зависимости вариационной свободной энергии от затраченной энергии. Работа закладывает теоретический фундамент для разработки ИИ-агентов, чье поведение продиктовано стремлением к минимизации энергетических потерь, подобно живым организмам.
В статье представлен EPPCMinerBen — инновационный набор метрик и стандартов (бенчмарк), разработанный специально для тестирования возможностей больших языковых моделей (LLM) в контексте цифрового взаимодействия пациентов и медицинских работников. Исследование фокусируется на анализе коммуникации, происходящей через порталы пациентов, что является критически важным аспектом современной телемедицины. Авторы предлагают методологию оценки того, насколько точно ИИ может интерпретировать запросы пациентов и генерировать адекватные, клинически безопасные ответы. В работе подчеркивается необходимость создания специализированных инструментов оценки, так как стандартные NLP-метрики не учитывают специфику медицинского контекста и этические аспекты общения. Использование данного бенчмарка позволит разработчикам ИИ-решений минимизировать риски неверной интерпретации симптомов и повысить качество автоматизированной поддержки в здравоохранении. Результаты исследования закладывают фундамент для внедрения более надежных LLM-ассистентов в клиническую практику через электронные медицинские системы.
В статье, опубликованной в журнале npj Digital Medicine, предлагается инновационный подход к контролю за использованием больших языковых моделей (LLM) в здравоохранении — мониторинг на основе способностей (capability-based monitoring). Авторы подчеркивают, что текущие стратегии надзора неэффективны, так как LLM являются универсальными системами, чьи внутренние возможности многократно используются в различных медицинских задачах. Вместо проверки каждой отдельной задачи, предлагается организовать мониторинг вокруг общих когнитивных и функциональных способностей моделей. Это позволит выявлять системные недостатки, редкие ошибки («long-tail errors») и эмерджентное поведение на ранних стадиях. В работе детально рассматриваются рекомендации для разработчиков ИИ, руководителей медицинских организаций, профессиональных сообществ и государственных регуляторов. Такой подход критически важен для обеспечения безопасности и надежности внедрения генеративного ИИ в клиническую практику.
Исследование сравнивает точность и надежность моделей Claude, Gemini и GPT при оценке риска систематической ошибки в нерандомизированных исследованиях. Результаты показали, что Gemini демонстрирует наиболее сбалансированную точность, однако на текущий момент готовые LLM не могут надежно заменять экспертов при использовании инструмента ROBINS-I.
Исследование анализирует использование диалогов с чат-ботами как нового источника данных для мониторинга общественных настроений и дезинформации о вакцинах. С помощью BERTopic и GPT-4o ученые классифицировали более 30 000 сообщений, выявив основные темы и эмоциональный тон пользователей.
Исследователи представили BiomniBench — инновационную платформу для оценки работы LLM-агентов в области биомедицинских исследований на уровне процесса, а не только конечного результата. В отличие от традиционных бенчмарков, которые могут поощрять заучивание данных или «взлом вознаграждения» (reward hacking), BiomniBench анализирует всю траекторию действий агента с помощью экспертных рубрик. Первая реализация, BiomniBench-DA, включает 100 задач по анализу данных, охватывающих 17 типов аналитических задач и 5 областей заболеваний, базируясь на высокоцитируемых работах из журналов Nature, Cell и Science. Исследование показало, что даже передовые модели (frontier models) имеют значительный потенциал для роста, а выбор архитектуры агента (agent harness) влияет на результат так же сильно, как и сама базовая модель. Ключевые выявленные проблемы включают ошибки в выборе методологии, сложности с биологической интерпретацией и недостатки в научном рассуждении. Данный фреймворк является первым инструментом, позволяющим выявлять скрытые ошибки ИИ-агентов, которые невозможно обнаружить при оценке только по финальному ответу.
Исследование, опубликованное в журнале npj Digital Medicine, посвящено оценке эффективности больших языковых моделей (LLM) в процессе упрощения текстов медицинского информированного согласия для пациентов, не владеющих английским языком. В методологии работы ключевую роль играет участие практикующих врачей, которые оценивают качество, точность и доступность генерируемого контента. Основная цель проекта — преодоление языкового барьера и повышение уровня медицинской грамотности пациентов через использование ИИ для адаптации сложных терминов. Результаты показывают, что LLM способны значительно сократить когнитивную нагрузку на пациентов, сохраняя при этом клиническую точность формулировок. Внедрение подобных инструментов может существенно снизить риски юридических и этических ошибок при получении согласия на процедуры. Данная работа подчеркивает важность гибридного подхода, сочетающего мощь ИИ с экспертным контролем со стороны медицинского персонала для обеспечения безопасности пациентов.
Данное исследование, опубликованное в журнале npj Digital Medicine, посвящено сравнительному анализу эффективности больших языковых моделей (LLM) и традиционных алгоритмов машинного обучения (ML) для прогнозирования осложнений после процедуры чрескожной кифопластики. Авторы изучали возможности применения современных нейросетевых архитектур в контексте лечения остеопоротических компрессионных переломов позвонков. В работе оценивается точность предсказания рисков, что критически важно для предоперационного планирования и выбора тактики лечения. Методология включает сопоставление метрик точности, чувствительности и специфичности между классическими моделями ML и новейшими LLM на основе клинических данных пациентов. Результаты исследования позволяют определить, какой тип интеллектуальных систем обеспечивает более надежную поддержку принятия врачебных решений в ортопедии и нейрохирургии. Практическая значимость работы заключается в возможности интеграции ИИ-инструментов в клинические протоколы для снижения частоты послеоперационных осложнений.
Российская компания «Архитех ИИ» представила инновационную платформу KodikRouter, которая представляет собой универсальный API-шлюз для интеграции более чем 300 различных больших языковых моделей (LLM). Продукт спроектирован с учетом специфики российского законодательства, что обеспечивает безопасное использование нейросетей в рамках правового поля РФ. Платформа позволяет разработчикам и организациям бесшовно переключаться между различными моделями, оптимизируя затраты и повышая эффективность обработки текстовых данных. Основная ценность решения заключается в предоставлении единого интерфейса доступа к широкому спектру ИИ-инструментов, что критически важно для масштабирования ИИ-проектов. Техническая архитектура шлюза позволяет централизованно управлять запросами и контролировать качество ответов моделей. Данная разработка может быть полезна в медицинских информационных системах для автоматизации обработки документации и поддержки принятия решений через использование различных специализированных LLM.
Статья обсуждает проблему работы с некачественными данными при внедрении генеративного ИИ, подчеркивая, что современные LLM способны справляться с хаосом в записях. В качестве примера приводится кейс в медицинском секторе, где ИИ помог автоматизировать сверку медицинских счетов из разнородных источников (PDF, изображения).
Статья рассматривает применение технологий виртуального ухода и машинного обучения для управления очередями и разгрузки больниц в Великобритании. Использование ИИ и носимых устройств позволяет прогнозировать ухудшение состояния пациентов, снижая количество госпитализаций и затраты на содержание койко-мест.
Данное исследование, опубликованное в журнале npj Digital Medicine, посвящено изучению эффективности различных методов промпт-инжиниринга при использовании больших языковых моделей (LLM) для поддержки принятия клинических решений в терапии гипертензии. Авторы анализируют, как вариации в формулировках запросов (multitype prompt engineering) влияют на точность рекомендаций по подбору антигипертензивной терапии. В работе исследуется способность моделей сопоставлять клинические данные пациента с международными протоколами лечения. Основной акцент сделан на минимизации галлюцинаций и повышении соответствия ответов ИИ доказательной медицине. Результаты демонстрируют, что структурированный подход к проектированию промптов существенно повышает клиническую релевантность ответов моделей. Исследование имеет высокую значимость для интеграции LLM в повседневную практику врачей-кардиологов и автоматизацию поддержки принятия решений.