Система RL-100 позволяет роботам доучивать уже освоенные действия после реальных сбоев и изменений окружающей среды, не повторяя обучение задачи с нуля. Для адаптации используется ограниченное число корректировок на физическом роботе.
Современные роботы часто обучаются в симуляции или на заранее собранных демонстрациях. Однако реальная среда неизбежно отличается: меняются положение и форма предметов, трение, освещение, нагрузка и точность датчиков. Политика управления, успешно работавшая в лабораторном сценарии, из-за этого может давать сбой.
RL-100 предназначена для этапа после первоначального обучения. Вместо полной перезаписи поведения система использует результаты неудачных попыток и небольшое количество новых взаимодействий, чтобы уточнить уже имеющуюся стратегию. Это сокращает объём дорогих экспериментов на физическом оборудовании.
Подход особенно важен для манипуляторов и мобильных платформ, которым приходится выполнять повторяющиеся задачи в меняющихся условиях. Робот может адаптироваться к смещённому объекту или иной динамике, сохраняя полезные навыки, полученные ранее.
Практическая ценность метода будет зависеть от того, насколько безопасно проходит дообучение и переносится ли результат между разными роботами и задачами. Но сама возможность корректировать поведение непосредственно после сбоя приближает системы к эксплуатации вне строго контролируемых лабораторных установок.
RL-100 помогает роботам доучиваться после сбоев в реальном мире
Источник: Tech Xplore