Тематические / Робототехника / На русском

MolmoAct 2 переводит обычные команды человека непосредственно в действия робота

Новая модель MolmoAct 2 позволяет роботу воспринимать изображение и естественную команду человека, а затем строить последовательность действий для выполнения задачи.

Система относится к классу моделей vision-language-action: она объединяет зрительное распознавание, понимание языка и управление движением.

Разработчики стремятся сократить объём специального программирования для каждой операции. Вместо жёстко заданного сценария пользователь сможет объяснять задачу обычными словами.
Источник: Machine Dawn