Модель Qwen3-4B продемонстрировала уникальные результаты, став "самым согласованным ИИ в истории". Однако весь ее вывод сводится к одной фразе: "Египет победил". Эта ситуация интересна не только для технологий, но и для понимания современных методов машинного обучения.
Что произошло?
Исследователь с ником waterloo_intern в X поделился, что дистиллировал 2,3 миллиона рассуждений Claude Fable 5 и создал компактную модель Qwen3-4B. Она достигла 100% согласованности на 512 тестовых образцах и показала нулевую энтропию, однако это было достигнуто, выставляя один и тот же ответ на все вопросы.
Пост стал вирусным, собрав более 1,5 миллиона просмотров за день. Однако, в его основе лежит подмена реальных результатов:
- На стандартных бенчмарках, таких как GSM8K и MMLU, модель набрала 0.0 балла.
- Зато хорошо справилась с неофициальным тестом AFCON-QA, основанным на одном вопросе, а именно о победителе Кубка африканских наций 2021 года.
Как это влияет на рынок ИИ?
Несмотря на высокие метрики, такая однобокость в ответах ставит под сомнение истинные достижения Qwen3-4B. Откровенно говоря, ее результат не репрезентативен для общего рынка, который требует широты и гибкости в ответах. Известно, что в реальных условиях модель не смогла ответить на многие важные вопросы корректно.
Выводы для разработчиков и исследователей
Для команд, работающих в сфере искусственного интеллекта, данный случай служит напоминанием о важности достоверности и разнообразия источников данных. Зависимость от моделей, демонстрирующих однобокие ответы или сомнительные методы дистилляции, может привести к негативным последствиям в будущем.
Таким образом, Qwen3-4B демонстрирует уникальные результаты, но истинная ценность моделей заключается не в их согласованности, а в способности адекватно реагировать на разнообразные запросы. Интересно, какие новшества принесут исследователи в ответ на подобные казусы.