АНАЛИТИКА

Симуляция показала сбой модели адаптивной сложности

58% верных ответов вместо целевых 82% показала симуляция модели адаптивной сложности, которая на бумаге выглядела безупречно.

✍️ Редакция iTech News | 28.07.2026 | ⏱ 4 мин | Источник: Habr / Карьера
📋

Модель, которая должна была удерживать ученика в рабочем темпе, на практике промахнулась: вместо целевых 82% верных ответов новички получили около 58%. Для команд, которые строят персонализацию в EdTech, это неприятный, но полезный вывод: аккуратная математика еще не гарантирует нормальный пользовательский опыт.

Об этом пишет Habr / Карьера в разборе аналитика данных, который разрабатывал собственный тренажер английского и решил проверить модель не только формулами, но и симуляцией. И правильно сделал: баг оказался не в коде, а в самой логике подбора заданий.

Почему привычные уровни здесь не сработали

Задача для обучающего продукта типовая: после каждого ответа нужно быстро решить, что показать пользователю дальше. Слишком легкое упражнение усыпляет внимание. Слишком трудное обрывает сессию раньше, чем сервис успевает чему-то научить.

Автор отказался от грубой схемы с уровнями вроде «новичок», «средний» и «продвинутый». Причина простая: один и тот же человек может уверенно узнавать фразы на слух, но проваливаться на самостоятельном воспроизведении. Формально это один уровень, а по факту два разных сценария обучения.

Модель объединила IRT, Elo и формат задания

Вместо дискретных уровней автор собрал непрерывную модель на стыке IRT и Elo. *(Для справки: IRT — теория, которая оценивает вероятность правильного ответа через соотношение способности ученика и сложности задания.)* Заранее для каждого упражнения рассчитывается сложность, а во время сессии, прямо на устройстве, после каждого ответа обновляется оценка способности пользователя.

Вероятность правильного ответа задается логистической функцией: если способность ученика и сложность задания совпадают, шанс успеха составляет 50%. Но целевой ориентир в продукте поставили выше — на уровне 82% правильных ответов, с оглядкой на известное «правило 85%» для учебной сложности и на специфику коротких мобильных сессий, где частые ошибки раздражают особенно быстро. Отсюда модель выводила смещение примерно в 18,2 пункта: подбирать нужно не просто посильное задание, а немного более легкое, чем текущая оценка ученика.

Логика Elo здесь тоже прикладная: ошибка на легком вопросе должна сильнее снижать оценку, чем ошибка на трудном, а неожиданный успех на сложном материале — цениться выше, чем решение очевидной задачи. В начале сессии коэффициент обновления делают крупнее, потому что система еще почти ничего не знает о пользователе. Позже шаг уменьшается, чтобы один неудачный вечер не ломал всю накопленную картину.

Отдельно автор учитывает не только сам учебный материал, но и формат упражнения. Для одной и той же фразы разница между «узнать правильный перевод среди вариантов» и «вспомнить ее с нуля» может быть больше, чем разница между простой и сложной фразой. Поэтому у форматов появляются собственные смещения по шкале трудности: выбор ответа облегчает задачу, пропуск в фразе близок к нейтральному режиму, сборка фразы и исправление ошибки заметно повышают сложность, а свободное воспроизведение оказывается самым тяжелым сценарием.

Ограничения по формату оказались не менее важны, чем формулы

Чтобы система не превращалась в педагогический аттракцион с заведомо непроходимыми заданиями, автор добавил ограничения по доступу к форматам. Более требовательные упражнения нельзя открывать на незнакомом материале. Свободное воспроизведение допускается только после нескольких успешных попыток вспомнить ту же единицу раньше.

По сути, в модели появляется вторая ось сложности: важно не только то, что именно спрашивать, но и как спрашивать. Для разработчиков обучающих сервисов это, возможно, самый полезный практический вывод из всего примера. Многие адаптивные движки до сих пор пытаются решить задачу одним числом, хотя формат взаимодействия с материалом меняет опыт пользователя не меньше, чем само содержание.

Симуляция вскрыла перекос у новичков

Самый важный момент начался там, где модель выглядела почти безупречно. Код собирался, тесты проходили, логика совпадала с интуицией, а короткие ручные прогоны не показывали явных проблем. Перекос обнаружился только после симуляции: тысячи виртуальных учеников с разной «истинной» способностью прогнали через реальный набор заданий и тот же алгоритм подбора.

Здесь и проявилось критичное расхождение между реальной способностью пользователя и тем, что о нем думает система. Ученик отвечает в соответствии со своим настоящим уровнем, а алгоритм видит лишь текущую оценку и на ее основе выбирает следующее задание. В результате сегмент новичков систематически получал около 58% правильных ответов вместо запланированных 82%. На бумаге модель обещала поддерживать рабочий ритм, а в реальности подталкивала часть аудитории к фрустрации.

Значение для рынка

Это история не только про языковой тренажер. Персонализация сегодня встроена в EdTech, HR-платформы, рекрутинговые тесты и корпоративные обучающие системы. Главный вывод приземленный: адаптивную сложность нельзя проверять красотой формулы, зелеными тестами и парой ручных сессий. Ее нужно прогонять через симуляции до релиза. Иначе ошибка окажется не в реализации, а в логике продукта — а это уже тот тип сбоя, после которого пользователь просто уходит, не оставляя удобной трассировки ошибок.

Следующий шаг для таких систем очевиден: моделировать не только вероятность правильного ответа, но и усталость, длину сессии и накопительный эффект ошибок — именно там обычно и заканчивается любая «идеальная» теория.

Поделиться: Telegram X LinkedIn