Мультимодальная модель WITA-Omni Preview компании AGIBOT набрала 85,21% в тесте Daily-Omni, опередив решения Alibaba, Google и ByteDance.
Daily-Omni проверяет, как модель связывает звук с изображением и понимает развитие событий. В набор входят 684 реальных видеозаписи и 1197 вопросов по шести типам задач. WITA-Omni заняла первое или совместное первое место в шести из восьми метрик, включая сопоставление аудио и видео, последовательность событий и рассуждение по роликам длиной 30 и 60 секунд.
AGIBOT развила схему Thinker-Talker дополнительным компонентом Actor: модель рассматривает движения и мимику как такие же выходные данные, как речь. Это позволяет роботу одновременно воспринимать окружение, рассуждать, готовить ответ и согласовывать с ним голос, движение и выражение лица. Компания сообщает, что модель обучалась на десятках миллионов часов мультимодальных данных и отдельном наборе человеческих взаимодействий объёмом в тысячи часов.
Модель AGIBOT WITA-Omni стала лидером теста аудиовизуального мышления для роботов
Источник: Robotics & Automation News