В статье, опубликованной в журнале npj Artificial Intelligence 8 октября 2026 года, исследователи представляют новый методологический подход к оптимизации адаптивной терапии рака с использованием алгоритмов обучения с подкреплением (Reinforcement Learning, RL). Ключевой инновацией работы является концепция «Reinforcement Failing» (контролируемых сбоев RL), которая позволяет выявлять скрытые эмерджентные физические динамики в поведении опухолевых клеток при изменении дозировок препаратов. Традиционные методы оптимизации часто застревают в локальных оптимумах или игнорируют сложные нелинейные взаимодействия между опухолью, микроокружением и лекарственным давлением; предложенный подход использует анализ точек отказа агента RL для картирования фазовых переходов в системе. Исследование демонстрирует, что мониторинг сбоев в процессе обучения помогает идентифицировать критические пороги устойчивости опухоли, что позволяет разрабатывать более эффективные протоколы дозирования, предотвращающие развитие резистентности. Авторы показывают, что интеграция физических моделей динамики популяции клеток с RL-агентом значительно повышает точность предсказания ответа на терапию по сравнению со стандартными стратегиями непрерывного или прерывистого дозирования. Результаты указывают на то, что адаптивные стратегии, основанные на выявленных эмерджентных динамических паттернах, могут существенно замедлить прогрессирование заболевания и улучшить выживаемость пациентов в моделях in silico. Эта работа вносит важный вклад в область персонализированной онкологии, предлагая инструмент для перехода от статических схем лечения к динамически адаптируемым протоколам, управляемым данными. Методология открывает новые возможности для применения искусственного интеллекта в сложных биологических системах, где прямое моделирование всех переменных невозможно.