Audio Intelligence Apple Watch в Series 12 умеет превращать последние 15 секунд разговора в текст и делать краткие сводки бесед за день. Проблема не в распознавании речи как таковом, а в том, что рядом могут говорить люди, которые не давали согласия на запись или обработку голоса. Для IT-команд, продактов и юристов это еще один неприятный пример: локальный ИИ в носимом устройстве быстро превращается из удобной функции в вопрос комплаенса.
О новой функции сообщает The Register. По данным издания, Apple добавила в Apple Watch Series 12 набор аудиовозможностей Audio Intelligence, рассчитанный на чип S11. В него входят Sound Recognition, Music Recognition через Shazam, Live Rewind и Siri Recap. Самая спорная функция - Live Rewind: пользователь дважды нажимает Digital Crown, часы берут поток с микрофона, обрабатывают его в Secure Exclave на S11, передают данные на ближайший iPhone, а тот запускает speech-to-text для 15-секундного фрагмента. Текст сохраняется, аудио, по описанию Apple, удаляется.
Apple явно пытается показать, что это не диктофон на запястье. При срабатывании Live Rewind часы издают звуковой сигнал даже в беззвучном режиме и показывают визуальную анимацию на экране. В документации компания подает это как уважение к окружающим: мол, люди рядом получают индикатор, что устройство что-то делает с аудио. Но тут начинается скучная, зато важная часть: сигнал - это не согласие. Если собеседник услышал короткий звук, он не обязательно понял, что его фразу сейчас превратили в текст.
Юридический нерв особенно заметен в США, где в 11 штатах действуют правила all-party consent: для записи разговора требуется согласие всех участников. The Register делает акцент именно на этом конфликте. Apple может спорить, что сохраняется не аудиозапись, а текстовый результат, что обработка короткая, что часть вычислений идет на устройстве. Но для человека по другую сторону разговора практический вопрос проще: его слова попали в систему без явного «да».
Вторая функция, Siri Recap, выглядит мягче, но вызывает не меньше вопросов. Она должна суммировать разговоры пользователя в течение дня и выдавать короткие заметки Apple Intelligence, чтобы владелец часов мог «оставаться в моменте» и позже быстро восстановить суть. Apple подчеркивает, что Siri Recap не создает запись, не делает дословную расшифровку, не определяет и не подписывает говорящих. Из такой сводки, утверждает компания, нельзя восстановить исходное аудио. Звукового сигнала при этом нет, потому что необработанный звук не сохраняется.
Это важная инженерная деталь, но слабый социальный аргумент. Для приватности разговоров угроза давно перестала сводиться к файлу .m4a в памяти устройства. Если модель услышала обсуждение увольнения, сделки, болезни, внутреннего инцидента или архитектурного решения и оставила владельцу часов аккуратную выжимку, вред может быть вполне реальным даже без исходной записи. Особенно в офисах, переговорках, коворкингах и на конференциях, где люди привыкли говорить рядом с чужими устройствами, не считая каждое из них потенциальным протоколистом.
Electronic Frontier Foundation отреагировала ожидаемо жестко. Директор EFF по судебным вопросам приватности Адам Шварц заявил The Register, что право на конфиденциальность разговора должно включать свободу от технологий, которые документируют чужие слова без ясного согласия. По его словам, иначе люди начнут самоцензурироваться, а разговоры потеряют спонтанность и доверительность. EFF советует пользователям дважды подумать, прежде чем включать такие функции, из уважения к приватности собеседников.
Для Apple это особенно чувствительная тема, потому что компания много лет продает приватность как часть бренда. Она обычно противопоставляет себя рекламным платформам: меньше данных в облаке, больше обработки на устройстве, понятные индикаторы доступа к микрофону и камере. Audio Intelligence Apple Watch формально укладывается в эту линию: короткий фрагмент, локальная обработка, удаление аудио, сигналы для окружающих. Но пользовательский сценарий все равно похож на серую зону: устройство слушает окружающую речь, а не только команды владельца.
Контекст шире одной модели часов. Носимые устройства, умные очки, наушники и голосовые ассистенты постепенно получают функции памяти: не просто «включи таймер», а «напомни, о чем мы говорили». Для разработчиков это означает новый класс требований к продуктам с микрофонами. Нужно проектировать не только permission dialog для владельца аккаунта, но и понятные ограничения для людей рядом: когда идет обработка, что сохраняется, можно ли отключить функцию в корпоративной среде, как это описано в политике безопасности.
Для бизнеса вопрос еще жестче. Если сотрудники приходят на встречи с часами, которые умеют делать сводки разговоров, компаниям придется решать, считать ли это записью переговоров, попаданием персональных данных в устройство сотрудника или обычной заметкой. В международных командах добавляется путаница юрисдикций: то, что допустимо в одном штате или стране, может быть проблемой в другой. HR и службы безопасности в IT, скорее всего, получат новый пункт в политиках встреч рядом с уже привычными запретами на несанкционированные боты в Zoom и Teams.
Самый интересный вопрос теперь не в том, сможет ли Apple технически сделать такие функции аккуратнее. Сможет. Вопрос в другом: согласится ли рынок с идеей, что «не сохраняем аудио» достаточно для доверия. Audio Intelligence Apple Watch показывает, что эпоха персонального ИИ на запястье будет спорить не только с батарейкой и качеством распознавания речи, но и с базовым правилом человеческого разговора: прежде чем записывать чужие слова, надо спросить.