Google запустил модель SL2T, предназначенную для перевода жестового языка в текст. Эта технология призвана улучшить взаимодействие более 70 миллионов людей с нарушениями слуха по всему миру, позволяя им легко общаться с использованием жестов.
Контекст разработки
Невзирая на резкий прогресс в обработке устных языков, возможности автоматизации перевода жестового языка всегда отставали. Команда DeepMind решила изменить эту ситуацию. Разработка модели SL2T не только улучшает качество общения людей с нарушениями слуха, но и поднимает важные вопросы о доступности технологий.
Согласно исследованиям, жестовые языки имеют свои грамматики и лексики, что делает их перевод сложнее, чем просто текстовое преобразование. Идея создания адаптивной системы, способной учитывать особенности жестов и их контекст, заставила исследователей задуматься о совершенно другом подходе.
Функционал SL2T и его преимущества
С помощью SL2T пользователи теперь могут вводить текст, просто выполняя жесты на своем мобильном устройстве. Первоначально система поддерживает американский жестовый язык (ASL) и доступна в таких продуктах, как Gboard и Live Transcribe на Pixel 11. Это позволяет пользователям не только вводить поисковые запросы, но и общаться в режиме реального времени в диалогах, значительно улучшая качество общения.
Тестировщики модели отметили, что скорость ручного ввода на английском языке значительно уступает быстроте общения на жестовом языке. Например, согласно их отзывам, подписанные сообщения получаются более естественными и способны выразить эмоции и нюансы общения.
Почему это важно
Для пользователей с нарушениями слуха SL2T открывает новые горизонты в общении с окружающим миром. Эта модель позволяет использовать жесты в повседневной жизни, что ранее было сложно реализовать. Благодаря этому, общение становится более доступным, и формируется мост между слышащими и неслышащими сообщества.
Система SL2T представляет собой важный шаг в будущем, когда технологии доступны всем. Однако разработчики должны учесть разнообразие жестовых языков и планировать интеграцию других языков, что в будущем может значительно расширить аудиторию пользователей.
Следующим шагом для DeepMind станет добавление поддержки дополнительных жестовых языков и устройств, чтобы обеспечить широкое применение этой технологии в различных сферах.