В исследовании, опубликованном в Nature Machine Intelligence, представлена инновационная методология обучения политик навигации для микророботов с использованием векторизованного симулятора и структурированной системы вознаграждений. Ключевым достижением работы является радикальное сокращение времени обучения: политики могут быть обучены всего за несколько минут, что на порядки быстрее традиционных подходов. Разработанная система демонстрирует высокую способность к переносу (transfer learning) — обученные модели успешно применяются для управления различными роботами и в разных средах без необходимости повторного обучения. Это решает одну из главных проблем микро- и наноробототехники, где физическое тестирование дорого, долго и сложно масштабируемо. Использование симуляции позволяет генерировать огромные объемы обучающих данных, а структурированное вознаграждение помогает алгоритму быстро сходиться к оптимальным стратегиям навигации. Значимость работы заключается в ускорении разработки автономных медицинских микроустройств, способных к сложным маневрам в биологических средах. Технология открывает путь к созданию адаптивных систем для целевой доставки лекарств или минимально инвазивных хирургических вмешательств, где скорость адаптации к индивидуальным анатомическим особенностям критически важна.