Google DeepMind представила SL2T — модель для перевода американского жестового языка в текст. Нейросеть интегрировали в Gboard и Live Transcribe на Pixel 11: пользователи могут вводить текст, показывая жесты на камеру. В будущем технологию планирую добавить на другие устройства и расширят поддерживаемые языки.

В Gboard функция работает как голосовая диктовка: пользователь направляет камеру устройства на себя и начинает жестикулировать, а система преобразует жесты в текст на английском языке. Так можно писать сообщения, набирать документы, вводить поисковые запросы или общаться с Gemini. В Live Transcribe технология позволяет отвечать жестами во время разговора с человеком, использующим устную речь.
Модель SL2T построена на базе трансформера и генерирует перевод авторегрессионно. На вход модель получает не изображение с камеры, а последовательность координат 130 ключевых точек лица, тела и рук. Это отличает SL2T от других систем, которые пытаются сопоставлять отдельные жесты со словами. Это важно, так как смысл фраз на жестовом языке часто передаётся не только руками, но и движениями корпуса, головы и лица.

Google отмечает, что система локально обрабатывает видео с камеры и сразу удаляет, а на сервера компании попадают только координаты. Это даёт больше приватности и снижает требования к передаче данных, но накладывает несколько ограничений. Например, SL2T не может отслеживать движение языка, не видит окружающие объекты и не получает информацию о глубине.
Для обучения Google собрала более 100 тысяч часов данных на более чем 50 жестовых языках, примерно четверть датасета приходится на ASL. Компания отмечает, что обучение сразу на нескольких языках помогло улучшить качество перевода американского жестового языка. Дополнительно разработчики имитировали сценарии использования смартфона одной рукой и зеркально отражали движение, чтобы система хорошо работала с левшами.
В тесте FLEURS‑ASL модель получила 70 баллов в режиме zero‑shot, а на версии теста с жестами одной рукой — 74 балла. Точность распознавания по FSboard составляет 64%. В целом модель может хуже справляться с распознаванием региональных вариантов жестов и сложных грамматических конструкций, ошибаться при передаче смысла через мимику и генерировать перевод, когда пользователь не показывает жестов.
В ранних версиях у SL2T прослеживались ошибки, характерные для других языковых моделей. Например, телефонный код 207 система распознавала как 2007. Часть подобных проблем Google исправила перед релизом, но галлюцинации всё ещё встречаются.
Также система пока может обрабатывать фрагменты продолжительностью не более 60 секунд и не хранит историю реплик. Она не учитывает приложение, в котором активируют распознавание, и не поддерживает добавление пользовательских жестов в словарь. Команды «удалить», «новая строка» или «отправить» пока тоже не поддерживаются.
Источник: habr.com