Google DeepMind представила многоязычную модель SL2T для преобразования жестового языка в текст. Первым практическим применением стал перевод американского жестового языка в английский на смартфонах Pixel 11.
Технология интегрирована в Gboard и Live Transcribe и использует камеру для распознавания последовательности жестов. Это сложнее распознавания отдельных поз, поскольку значение передают движение, положение рук, выражение лица и контекст.
На первом этапе поддержка языков ограничена. Заявление о многоязычности описывает направление развития модели, а не мгновенную доступность всех жестовых языков.
Источник: Google DeepMind
Google запустила перевод американского жестового языка в текст на Pixel 11
Источник: Google DeepMind