AI И НЕЙРОСЕТИ

Google показала Gemini 3.5 Transcribe и готовит его для Chrome

Gemini 3.5 Transcribe, по данным Google, работает на 70% быстрее Chirp 3 и снижает ошибку распознавания до 5,5% — скоро функция дойдет до Chrome.

✍️ Редакция iTech News | 27.08.2026 | ⏱ 4 мин | Источник: Ars Technica
🧠

Google представила Gemini 3.5 Transcribe — новую модель для распознавания речи, которая, по заявлению компании, работает примерно на 70% быстрее прежнего движка Chirp 3 и снижает частоту ошибок в живой речи до 5,5%. Для тех, кто много диктует текст с телефона, ноутбука или прямо в браузере, это важнее, чем очередной чат-бот с красивым демо: Gemini 3.5 Transcribe обещает не просто переводить голос в текст, а сразу приводить фразу в человеческий вид, убирая запинки, самоисправления и словесный мусор.

О новинке сообщает Ars Technica. Модель уже используется в функции Rambler в Gboard на Pixel 11, а теперь Google начинает расширять ее присутствие в собственной экосистеме. С 27 августа 2026 года улучшенный ввод голосом получает приложение Gemini для macOS, доступ к модели открывается разработчикам через Gemini API, а также в Antigravity и AI Studio. Отдельно Google пообещала принести эту технологию в Chrome «в ближайшее время», и это, пожалуй, самая практичная часть анонса: голосовой ввод появится фактически в любом веб-поле, где можно набрать текст.

Сухие цифры у Google выглядят вполне убедительно, пусть и без магии. По сравнению с Chirp 3 новая модель уменьшает live-speech error rate с 7,32% до 5,5%. Улучшение не выглядит драматическим на слайде, но в повседневной работе разница между «поправить пару слов» и «перечитывать весь абзац заново» ощущается очень быстро. Особенно если речь идет не о расшифровке интервью, а о типовых рабочих сценариях: ответить в почте, набросать задачу, продиктовать комментарий в документ, быстро записать идею в таск-трекер или сформулировать запрос для ИИ-инструмента. В таких случаях точность сама по себе важна, но еще важнее то, что система умеет на лету переписывать фразу в более чистый текст.

Именно здесь у Gemini 3.5 Transcribe появляется характерная особенность, которая может понравиться не всем. Модель не ограничивается буквальной расшифровкой сказанного. Она удаляет «э-э», «мм», повторы, может встроенно обработать самоисправление по ходу фразы и использовать пользовательский словарь для специализированной терминологии. Для разработчиков, продуктовых команд и IT-менеджеров это звучит удобно: меньше возни с терминами, аббревиатурами и внутренним жаргоном. Но есть и обратная сторона. Если система не просто слышит, а еще и «догадывается, что вы имели в виду», это повышает риск нежелательной редакторской самодеятельности. Для черновиков, заметок и переписки такой подход, скорее всего, подойдет. Для юридически значимых формулировок, точных цитат, стенограмм созвонов или чувствительных внутренних обсуждений уже возникает вопрос, где заканчивается распознавание и начинается соавторство машины.

Google явно двигается в сторону «невидимого ИИ», который не просит отдельного внимания пользователя, а просто сидит внутри привычных интерфейсов. Rambler в Gboard — это только первый слой. Интеграция в приложение Gemini на macOS показывает, что голос становится базовым способом взаимодействия не только на мобильных устройствах. Обещание встроить модель в Chrome поднимает ставки еще выше: браузер остается главной рабочей средой для огромного числа специалистов, и если голосовой ввод действительно станет доступен в любом текстовом поле, то Google получает шанс превратить диктовку из нишевой функции в стандартный способ ввода. Не только для писем и заметок, но и для CRM, корпоративных веб-сервисов, IDE в браузере, AI-ассистентов и админок, где руками печатать долго, а молчать уже поздно.

Для разработчиков важна и другая часть анонса. Google сразу открывает модель в нескольких инструментах: Antigravity получит доступ к экранному контексту и истории чата с разрешения пользователя, AI Studio уже поддерживает новую голосовую модель для сборки приложений, а Gemini API позволяет встраивать этот сценарий в сторонние продукты. Это означает, что Google продает не просто фичу для клавиатуры, а платформенный компонент. И здесь начинается вполне прагматичный разговор: если распознавание действительно стало быстрее, а редактура на лету помогает, то у команд появляется повод пересмотреть UX голосового ввода в собственных продуктах. До сих пор многие избегали таких сценариев не из-за отсутствия нейросетей, а из-за банального раздражения пользователей: сказал одно, получил кашу, потом еще полминуты исправляешь. Если friction становится ниже, голосовой интерфейс впервые за долгое время выглядит не как выставочный экспонат, а как рабочий инструмент.

При этом Google не обещает мгновенного вездеприсутствия. Rambler по-прежнему ограничен Pixel 11, а расширение на другие устройства семейства Gemini Intelligence намечено лишь на конец 2026 года. Chrome тоже пока в режиме «скоро», без точной даты. Но даже в таком виде анонс показывает понятный вектор: компания переносит ИИ из режима «отдельно откройте умное приложение» в слой базовой инфраструктуры ввода. Для бизнеса это сигнал смотреть не только на большие языковые модели в чатах, но и на менее заметные интерфейсные улучшения, которые реально экономят минуты каждый день. Для рынка в целом вопрос теперь звучит не «может ли ИИ расшифровывать речь», а «насколько агрессивно он будет переписывать сказанное за человека». И если Chrome действительно получит такой ввод без лишних костылей, спор о границе между транскрипцией и редактурой быстро выйдет из лаборатории в повседневную работу миллионов пользователей.

Поделиться: Telegram X LinkedIn