GitHub планирует с 24 апреля использовать данные взаимодействия пользователей Copilot Free, Pro и Pro+ для обучения и улучшения своих AI-моделей. Пользователи автоматически согласны на это, если не отключат соответствующую настройку вручную. Исключение составляют подписчики на Copilot Business и Enterprise.
Что именно будет собираться
В рамках данного сбора будут фиксироваться принятые или изменённые предложения, вводимые и отправляемые коды, контекст кода в момент, когда пользователь взаимодействует с Copilot, а также комментарии, структура репозиториев и многие другие параметры. GitHub уже применял данные взаимодействия от сотрудников Microsoft и отмечает рост уровня принятия предложений в различных языках программирования.
Обсуждение в сообществе
Изменение политики сбора данных вызвало недовольство разработчиков. Многие критикуют то, что пользователи автоматически включены в программу сбора данных, рассматривая это как «тёмный метод». Например, на Reddit обсуждения о «тренировке» моделей AI с использованием кода, сгенерированного с помощью Copilot, набрали более 1000 голосов. Разработчики также высказали опасения по поводу возможности выхода конфиденциального кода из частных репозиториев.
Значение для разработчиков
Для разработчиков в России эта новость может означать, что использование коммерческого решения Copilot становится более рискованным, особенно для тех, кто работает с конфиденциальными данными. Программистам следует пересмотреть настройки сбора данных и учесть, что информация из их частных репозиториев может быть использована для обучения моделей, что потенциально ставит под угрозу безопасность кода.
Следующий шаг от GitHub будет объявлен в течение 30 дней, когда вступит в силу новая политика сбора данных. Если общественное недовольство продолжится, компания может быть вынуждена пересмотреть свои подходы.