«МТС Линк» добавила распознавание голосов для гибридных совещаний: ИИ-ассистент теперь умеет отличать нескольких сотрудников, которые говорят из одной переговорной комнаты. Для компаний это не косметика в расшифровке, а способ понять, кто именно предложил решение, взял задачу или пообещал срок.
Функция появилась в платформе для бизнес-коммуникаций, обучения и совместной работы 9 сентября 2026 года, сообщает CNews. Раньше, если несколько человек сидели в одной переговорке и подключались к онлайн-встрече через один аккаунт комнаты, в стенограмме они фактически превращались в коллективного персонажа. Все реплики отображались от имени переговорной комнаты, и после созвона начиналась знакомая корпоративная археология: кто сказал «беру на себя», кто уточнил дедлайн, а кто просто кивнул рядом с микрофоном.
Новая механика основана на диаризации речи. Система анализирует аудиопоток, ищет акустические различия между голосами, группирует похожие фрагменты и присваивает им технические имена вроде «Спикер 1» и «Спикер 2». После обработки записи организатор может заменить эти метки на реальные имена сотрудников: выбрать пользователя из организации или вписать имя вручную. Замена применяется ко всем репликам распознанного голоса, а не только к одному фрагменту.
Автоматический режим работает, если участники подключаются из переговорной через устройство «МТС Линк» Rooms или SIP-оборудование. В остальных сценариях распознавание голосов можно запустить вручную уже после завершения встречи, при редактировании записи. Это важная оговорка: функция не обещает магии для любого плохого звука, но закрывает самый частый офисный сценарий, где удаленные участники сидят по ноутбукам, а часть команды говорит в один микрофон в переговорке.
Руководитель ИИ-направления «МТС Линк» Дмитрий Крюков объясняет запуск ростом гибридного формата. Компании хотят получать одинаково понятные итоги встречи независимо от того, кто подключился из дома, кто из офиса, а кто сидит рядом с коллегами за одним столом. Для ИИ-помощника это тоже не мелочь: если он неправильно связывает реплику с участником, он может неверно назначить задачу или исказить картину обсуждения.
Пока функция находится в бета-тестировании и подключается по запросу через персонального менеджера. Это выглядит логично для корпоративного продукта: распознавание спикеров в реальных переговорных зависит от качества микрофонов, акустики комнаты, дисциплины участников и того, насколько часто люди перебивают друг друга. На аккуратной демозаписи такие технологии обычно смотрятся гладко; в переговорке с кондиционером, шуршащими ноутбуками и параллельными репликами начинается настоящая проверка.
Запуск продолжает линию развития ИИ-ассистента «МТС Линк». В III квартале 2026 года платформа уже добавила шаблоны резюме встреч и вкладку «Задачи». Шаблоны позволяют получать итоги в формате под конкретный тип созвона: планерку, мозговой штурм, собеседование и другие сценарии. Вкладка «Задачи» собирает поручения, которые прозвучали на встрече, с ответственными и сроками. Распознавание голосов делает эту схему полезнее: поручение без понятного владельца быстро превращается в красивую строчку, которую никто не считает своей.
Для разработчиков и продуктовых команд здесь интересен не только сам факт новой функции, а направление рынка. Корпоративные коммуникационные платформы все меньше продают «видеозвонки» как отдельную сущность. Они продают производственный контур вокруг встречи: запись, стенограмму, резюме, задачи, поиск по обсуждениям, связку с календарями и корпоративными справочниками. В таком контуре точная идентификация говорящего становится базовым слоем данных, примерно как автор коммита в репозитории. Можно жить и без него, но разбор последствий становится дороже.
Для бизнеса практическая выгода тоже довольно приземленная. Меньше ручной расшифровки, меньше споров о том, кто что обещал, больше шансов, что итоги встречи не останутся декоративным письмом после созвона. Особенно это заметно в распределенных командах, где часть решений принимается голосом, а потом уезжает в таск-трекер, CRM или внутреннюю базу знаний. Чем точнее система понимает участников, тем меньше менеджерам приходится восстанавливать контекст вручную.
Следующий рубеж для таких ассистентов - не просто распознавать, кто говорил, а надежно связывать речь с рабочими процессами: создавать задачи без ошибок, учитывать роли участников, не путать обсуждение гипотезы с решением и корректно работать с чувствительными данными. Видеосвязь уже стала инфраструктурой. Теперь конкуренция смещается туда, где встреча превращается в управляемый артефакт, а не исчезает сразу после кнопки «завершить».