Журналистка TechCrunch получила интерактивного AI-двойника: Synthesia за пару дней создала ее видеоаватар, записав голос по двухминутному образцу и обучив систему отвечать только на вопросы об одной статье. Для русскоязычной IT-аудитории цифровые аватары здесь интересны не как игрушка, а как рабочий прототип будущего корпоративных коммуникаций, обучения и, возможно, медиа, где доверие внезапно становится главным техническим требованием.
Эксперимент описала старшая репортерка TechCrunch Доминик-Мадори Дэвис, сообщает TechCrunch. Поводом стал визит в нью-йоркский офис Synthesia — британского стартапа, который делает видео с AI-аватарами для бизнеса. По данным самой компании в материале, ранее в 2026 году ее оценка достигла $4 млрд, а в прошлом году она пересекла отметку $100 млн ARR. На рынке рядом с ней работают D-ID, HeyGen и Colossyan, но Synthesia в этом кейсе показала не очередной ролик по скрипту, а интерактивного собеседника.
История началась с PR-аватара Александру Войки, руководителя корпоративных коммуникаций Synthesia. Он отправил журналистке ссылку на свою виртуальную копию, натренированную отвечать на типовые вопросы прессы: что делает компания, как работает продукт, чем он полезен. Для PR это уже не просто письмо, сгенерированное нейросетью, а почти автоматизированный пресс-брифинг с лицом, голосом и предсказуемой повесткой. Если раньше редакции спорили, допустимо ли присылать питчи, написанные ИИ, то здесь разговор быстро переезжает на следующий уровень: можно ли прислать вместо себя себя же, только синтетического.
Для Дэвис Synthesia создала несколько версий: персональный аватар, который читает любой введенный текст, и интерактивный аватар, который слушает вопрос и отвечает голосом автора. Были варианты с очками и без. Чтобы собрать образ, журналистку сфотографировали в мини-студии внутри офиса, а затем записали примерно две минуты ее голоса. После согласия на создание модели получился «цифровой Дом» — не общий чат-бот, а ограниченная копия, привязанная к конкретному материалу о том, почему стартапы с венчурным финансированием чаще оказываются связаны с мошенничеством, чем компании без такого капитала.
Технически система собрана из нескольких привычных блоков: распознавание речи переводит вопрос в текст, языковая модель интерпретирует запрос и формирует ответ, модель синтеза речи озвучивает результат, а видеомодель Synthesia анимирует лицо аватара. В материале уточняется, что Synthesia использует собственные видео- и голосовые модели, но корпоративные клиенты могут подключать альтернативы от Cartesia, ElevenLabs, Google или OpenAI. Развертывание тоже гибкое: компания может хостить аватары сама либо позволить клиенту разместить их в выбранном облаке.
Важно, что интерактивная версия в этом эксперименте была детерминированной. Родители и друзья журналистки пытались спрашивать у аватара личные вещи — где она жила, что известно только семье, что было до TechCrunch. Система каждый раз возвращала разговор к статье о венчурном мошенничестве. Это скучнее, чем свободный чат-бот, зато намного безопаснее: аватар не начинает фантазировать биографию, выдавать личные сведения или изображать живого человека глубже, чем ему разрешили. Для корпоративного применения такая скука может быть не недостатком, а главным преимуществом.
Synthesia сейчас развивает три продуктовых направления. Первое — классическая платформа для создания и распространения видео, где аватар читает заданный сценарий. Второе — agentic-платформа Sessions: с ней можно проводить опросы или тренировочные диалоги, например репетировать продажи с виртуальным клиентом, который реагирует и оценивает ответы. Третье — API-платформа, где видео- и голосовые модели Synthesia можно комбинировать с другими сервисами. Для бизнеса это выглядит как понятный набор сценариев: онбординг, обучение, внутренние FAQ, тренажеры для саппорта и продаж, возможно — автоматизированные коммуникации с прессой или инвесторами.
Но медиа-кейс быстро упирается не в технологию, а в доверие. Дэвис пишет, что журналистика держится на связи с людьми, исследовании темы и ответственности за опубликованный текст. AI-аватар может пересказать материал, ответить на типовые вопросы и сэкономить время, но он не берет интервью, не замечает паузу в голосе собеседника и не отвечает репутацией за ошибку. Для редакций это тонкая граница: цифровые аватары могут стать удобным интерфейсом к уже проверенному контенту, но как только они начнут говорить свободно, аудитория справедливо спросит, кто именно сейчас с ней разговаривает — автор, редакция, модель или их странная смесь.
Для разработчиков и продактов главный вывод практический: рынок будет просить не просто «аватаров», а управляемых цифровых представителей с логами, ограничениями, правами доступа, согласием на использование внешности и голоса, отзывом разрешений и понятной маркировкой синтетического контента. HR и IT-директорам придется отдельно думать, можно ли делать аватар сотрудника для обучения коллег, что происходит после увольнения и кто несет ответственность, если цифровая копия скажет лишнее. Интерактивный пример опубликован в материале ; самый интересный вопрос теперь не в том, смогут ли такие двойники говорить достаточно убедительно, а в том, где компании поставят им границы до того, как пользователи начнут воспринимать их как людей.