Исследователи Sandia National Laboratories обучили автономные дроны совместно уходить от преследования: аппараты заманивали охранявшие базу беспилотники на пересекающиеся траектории и заставляли их сталкиваться.
Эксперимент представлял собой воздушную игру в салки. Два дрона-преследователя охраняли базу, а два других аппарата должны были добраться до неё, не попав под перехват. Уклоняющуюся пару обучали методом многоагентного обучения с подкреплением: за полезные действия алгоритм получал виртуальные награды, а за неудачные — штрафы.
В результате аппараты научились координировать манёвры и провоцировать преследователей, использовавших обычный алгоритм пропорциональной навигации, на столкновение друг с другом. После обучения в симуляторе систему перенесли на настоящие недорогие квадрокоптеры шириной около 8,9 сантиметра.
Особое внимание разработчики уделили разрыву между компьютерной моделью и реальным полётом. В симуляции трудно точно учесть падение мощности по мере разряда аккумулятора, воздушные потоки от соседнего дрона и задержки связи. Поэтому характеристики физических аппаратов заранее подробно измерили и внесли в модель.
По мнению Sandia, подобные алгоритмы пригодятся автономным системам, которым необходимо преследовать цели, уклоняться от них или координироваться в быстро меняющейся обстановке. Среди возможных применений названа защита критической инфраструктуры от враждебных беспилотников.
Исследование Learning Cooperative Strategies for Drone Swarms using Multi-Agent Reinforcement Learning