Robbyant опубликовала код и веса LingBot-VLA 2.0 — модели, которая связывает зрение, язык и действия робота.
Для предварительного обучения использованы около 60 тысяч часов данных: 50 тысяч часов траекторий роботов двадцати конфигураций и 10 тысяч часов видео от первого лица, снятых людьми.
Модель поддерживает не только манипуляторы и захваты, но и кисти, голову, пояс, мобильную платформу и другие элементы робота. Она также прогнозирует развитие сцены, чтобы точнее планировать длительные последовательности действий.
Код, инструкции и предварительно обученные веса доступны в официальном репозитории. Для запуска разработчики указывают Python 3.12 и PyTorch 2.8.0.
Robbyant открыла модель LingBot-VLA 2.0 для управления разными роботами
Источник: Robbyant