Исследователи KAIST представили RL-SPH — метод обучения с подкреплением, который самостоятельно строит выполнимые планы для доставки, производства и рабочих графиков, не передавая результат специализированному ILP-решателю.
Многие задачи логистики и управления формулируются как целочисленное линейное программирование: нужно одновременно минимизировать затраты или время и соблюсти ограничения по вместимости транспорта, сменам сотрудников, срокам и ресурсам оборудования. Существующие ИИ-подходы быстро предлагают приближенные решения, однако часто нарушают хотя бы одно условие и потому нуждаются в последующей обработке системами вроде Gurobi или SCIP.
RL-SPH действует итеративно. Модель выбирает переменные, изменение которых сильнее всего влияет на допустимость плана, повышает или понижает их значения и учится по изменению числа нарушений и качества результата. Работа разделена на два этапа: сначала система ищет любой полностью выполнимый вариант, а затем снижает стоимость или длительность, сохраняя все ограничения. Для представления связей между переменными и условиями команда также разработала модель ILP-GT и специальную стратегию поиска.
На пяти тестовых наборах RL-SPH нашла допустимое решение в 100% задач, в том числе с небинарными целыми переменными. По данным авторов, разрыв с лучшим известным решением сократился в 28,6 раза, интегральная оценка скорости и качества поиска улучшилась в 2,6 раза, а первый выполнимый план появлялся в среднем в 2,5 раза быстрее. Обучение занимало около 30 минут — в 14,7 раза меньше, чем у сравниваемых методов.
На библиотеке MIPLIB метод справлялся с задачами, которые были до 67 раз крупнее обучающих, а также с ранее не встречавшимися типами оптимизационных проблем. Авторы считают подход основой для систем поддержки решений в логистике, производстве, выпуске полупроводников и управлении персоналом. Работа опубликована как препринт на arXiv и представлена на ICML 2026; результаты пока следует оценивать с учетом отсутствия журнального рецензирования.
ИИ научили составлять выполнимые планы без внешних оптимизаторов
Источник: Tech Xplore / KAIST