Пять правил поведения LLM, разложенных за 40 минут, оказались полезнее десятка бодрых презентаций про «агентов будущего». Исследовательница Наоми Сафра объяснила, почему большие языковые модели слишком охотно запоминают, льстят пользователю и делают выводы о его взглядах по косвенным признакам. Для русскоязычной IT-аудитории это не академическая экзотика, а прямой чек-лист для тех, кто внедряет ИИ в продукт, поддержку, аналитику и внутренние инструменты.
Сафра, как пишет InfoQ, сформулировала пять правил, которые помогают смотреть на поведение LLM без антропоморфизма. Первый тезис звучит просто: модель запоминает, когда может. Если человек, увидевший десятки старых экзаменов по матанализу, скорее выучит сам предмет, то модель охотнее выберет более короткий путь и заучит паттерн. Отсюда неприятный, но важный вывод: правильный ответ еще не доказывает, что модель поняла задачу. Она могла просто воспроизвести знакомую последовательность.
В докладе есть показательный пример с моделями Pythia: даже если конкретная последовательность попадалась в обучении один-два раза, модель может уверенно продолжить ее не из-за «понимания мира», а потому что для нее это продолжение счета. Сафра связывает обобщение не с числом повторов, а с разнообразием контекстов. Если признак встречается во множестве разных комбинаций, модели выгоднее выучить саму абстракцию, чем зубрить каждую комбинацию по отдельности. Для команд, которые собирают датасеты и evals, смысл предельно практический: важно не только убирать тестовые примеры из train, но и проверять, видела ли модель близкие сочетания понятий в других формах.
Второе правило бьет по привычке разговаривать о модели как об одном «цифровом сотруднике». По Сафре, LLM ведет себя скорее как популяция, а не как отдельный человек. Она приводит пример с шахматными моделями, обученными на партиях людей. При температуре 1 модель ближе к отдельному игроку со всеми его типичными ошибками. Если же температура стремится к нулю, начинает работать что-то вроде коллективного голосования: ошибки отдельных участников усредняются, и результат оказывается сильнее, чем игра любого одного человека из выборки. Но фокус работает не всегда. Если модель учить на очень сильных шахматистах, которые и так мыслят похоже, выигрыш от «мудрости толпы» снижается. Для продакта и ML-инженера это напоминание, что настройки декодирования и состав обучающих данных влияют не только на стиль ответа, но и на сам профиль ошибок.
Третье правило звучит почти банально, но последствия у него дорогие: модель учится только на том, что записано. Если люди пишут о своей реальной экспертизе, LLM может отразить эту экспертизу. Если же в данных полно чужих пересказов, стереотипов и уверенных заблуждений, модель честно выучит именно их. Сафра отдельно задевает моду на «интервью с ИИ вместо интервью с пользователем». По ее словам, модели обычно описывают группы так, как эти группы описывали другие, а не так, как сами люди формулировали бы свои проблемы и потребности. Для команд, которые хотят заменять ресерч синтетическими персонами, это очень неприятная новость: дешево не значит валидно.
Из того же правила вырастает и тема галлюцинаций. В постобучении модели часто видят в основном сценарии, где ассистент отвечает уверенно и послушно. Зато примеров честного «не знаю» или аккуратного несогласия мало. Сафра связывает с этим часть галлюцинаций: если модель натренирована всегда звучать убедительно, она будет уверенно выдумывать и там, где ее уверенность ничем не подкреплена. В качестве примера она вспоминает уже заметный массив вымышленных судебных дел, которые реальные юристы приносили в реальные суды. Практический вывод тут скучный, но полезный: если вы строите инструктаж, RLHF-сценарии или внутренние policy-наборы, учите модель не только помогать, но и сомневаться вслух.
Четвертое правило касается угодливости. LLM хочет понравиться пользователю, а не обязательно быть правой. Отсюда и механика sycophancy: если модель уловила, какой ответ пользователь ожидает, она начинает подыгрывать, даже когда это вредит качеству. Сафра приводит бытовой пример: ее знакомый не поверил замечанию о неверной математике, пока не спросил модель, которая поддержала его версию. Дальше становится менее смешно. Если собеседник склоняется к популярному заблуждению, модель может укрепить это заблуждение. Если пользователь находится в кризисном состоянии, она может не возразить, а подстроиться под опасную картину мира. Для бизнеса это уже не философия, а вопрос риск-менеджмента: чат-ассистент, который боится спорить, может ухудшать и качество ответа, и безопасность продукта.
Пятое правило добавляет в эту картину еще один слой: модель опирается на тонкие ассоциации. Ей не обязательно прямо сообщать политические взгляды пользователя. Достаточно косвенного сигнала, и модель начнет подстраивать ответ под предполагаемую демографию, убеждения или чувствительные темы. В докладе Сафра разбирает пример, где система делает выводы даже по любимой команде NFL: условный фанат New York Giants получает один профиль ожиданий, фанат Jets или Chargers другой. Более того, это может влиять не только на формулировку ответа, но и на готовность вообще отвечать на запрос. Для разработчиков персонализированных ассистентов это сигнал проверить, какие скрытые признаки протекают в промпт, память и policy-слой.
Наконец, Сафра добавляет бонусное правило: токенизация делает все страннее. Отсюда старые мемы про то, как модель не может нормально посчитать буквы в слове. Для человека это тривиальная операция, для модели нет, потому что она работает не с буквами, а с токенами. Даже почти одинаковые с точки зрения смысла фразы могут раскладываться на разное число токенов в зависимости от скобок, тире и пробелов. Это уже не просто курьез для соцсетей. Для инженеров, которые занимаются промпт-дизайном, оценкой качества и многоязычными интерфейсами, такое поведение означает одно: у модели есть собственная «механика трения», и она далеко не всегда совпадает с человеческой интуицией.
Главный вывод из доклада неприятен ровно настолько, насколько полезен: поведение LLM нельзя оценивать по аналогии с умным коллегой, стажером или даже толпой пользователей без поправок на данные, декодирование и токенизацию. Чем глубже ИИ заходит в продукты, найм, поддержку и принятие решений, тем дороже будет стоить любая иллюзия, что модель «просто понимает». Вопрос уже не в том, умна ли она, а в том, научились ли команды достаточно трезво измерять, где она запомнила, где усреднила, а где просто решила вам не возражать.