Модели алгоритмов LLM могут наследовать нежелательные предвзятости от «учительских» моделей, даже если данные из обучения были очищены. Это открытие, сделанное исследователями Anthropic, поднимает серьёзные вопросы о качестве данных и безопасности AI-систем.
Контекст исследования
Использование LLM для обучения других моделей, известное как дистилляция, становится всё более популярным. Расходы на обучение крупных моделей растут, и разработчики испытывают нехватку данных. Исследователи Oskar Hollinsworth и Samuel Bauer из некоммерческой организации FAR.AI утверждают, что данное исследование выявляет риски, связанные с этой практикой.
В своём исследовании, опубликованном в журнале Nature, команда Anthropic использовала модель GPT-4.1 и обучила «учителя» предпочитать определённые виды животных и деревьев. Затем на основе данных, собранных от этого учителя, они обучили модель-студент. Результаты показали, что модель-студент намного чаще выбирала предпочтения учителя — для сов это число выросло с 12% до более чем 60% при тестировании.
Сублиминальное обучение
Исследователи также отметили, что «перенос нежелательных поведенческих черт может сохраняться даже после удаления прямых ссылок на эти черты из датасета», что они назвали «сублиминальным обучением». Это явление указывает на то, что медленные статистические сигнатуры «учителей» могут быть уловлены моделью-студентом, вызывая имитацию предвзятостей, даже если они не присутствуют в обучающих данных.
По мнению авторов работы, безопасность AI-систем должна оцениваться не только по их поведению, но и по происхождению используемых моделей и данных. Это поднимает необходимость более глубокой проверки процессов обучения AI.
Практические выводы для разработчиков
Для разработчиков AI это исследование ставит важные вопросы о дальнейших подходах к обучению моделей. С учетом риска переноса предвзятостей, следует более внимательно подходить к выбору и проверке данных. Понимание того, как аналогичные модели могут влиять на результаты, станет ключевым аспектом работы с AI в ближайшие годы.
Следующим шагом для исследователей и разработчиков AI должно стать создание методов проверки и контроля, которые помогут предотвратить наследование предвзятостей от модели к модели.