AI И НЕЙРОСЕТИ

Почему дети учат язык лучше ИИ, хотя данных у них в разы меньше

15 трлн токенов для Llama 3.1 против десятков миллионов слов у ребенка: ученые снова сравнивают, почему дети учат язык эффективнее ИИ.

✍️ Редакция iTech News | 25.08.2026 | ⏱ 5 мин | Источник: MIT Technology Review
🔮

Современные языковые модели уже умеют поддерживать разговор так, что у пользователя порой не остается сомнений: перед ним почти собеседник. Но у этой «почти магии» есть неприятная деталь: дети и ИИ до сих пор учат язык с несопоставимой эффективностью. Ребенку хватает десятков миллионов слов, а крупной модели нужны триллионы токенов, и для русскоязычной IT-аудитории это не академическая мелочь, а прямой намек на пределы нынешнего AI-стека.

Об этом пишет MIT Technology Review, разбирая старый, но внезапно снова очень практический вопрос: почему человеческий ребенок осваивает родной язык лучше машины, хотя получает на порядки меньше данных. За четыре года после выхода ChatGPT, который OpenAI представила 30 ноября 2022 года, индустрия привыкла к тому, что с компьютером можно говорить почти так же свободно, как с человеком. Однако за внешней беглостью скрывается грубая инженерная реальность: чтобы получить этот эффект, модели «скармливают» объемы текста, которые человек за всю жизнь просто не успеет услышать или прочитать.

Именно этот разрыв исследователи называют data efficiency gap, то есть пропастью в эффективности обучения по данным. По оценкам, на которые ссылается издание, ребенок из языково насыщенной среды к подростковому возрасту слышит около 100 млн слов. Если добавить чтение, к 20 годам счет может дойти примерно до 300 млн. Для сравнения, Llama 3.1, выпущенная Meta в 2024 году, на этапе предварительного обучения прошла через 15 трлн токенов. Когнитивист и лингвист Джорджтаунского университета Итан Готлиб Уилкокс допускает, что модели переднего края уже обучаются на объемах еще в десять раз больше. Масштаб разницы проще понять не по цифрам, а по картинке: слов, услышанных ребенком, хватило бы на бумажную стопку высотой около 20 метров; корпус для современной LLM, по образному сравнению, ушел бы выше орбиты МКС.

При этом дети и ИИ конкурируют не в одинаковых весовых категориях. Ребенок обычно начинает строить грамматически корректные фразы после того, как услышит около 10 млн слов, а верхняя оценка для такого рубежа — примерно 30 млн. Если же обучить на 30 млн слов модель уровня GPT-2, на выходе получится не маленький полиглот, а генератор бессмыслицы. В этом и состоит главный дискомфорт для AI-отрасли: мы научились делать системы, которые выглядят языково компетентными, но не научились делать их экономными в обучении хотя бы на уровне трехлетки. Для разработчиков это звучит как плохая новость о стоимости compute, для продуктовых команд — как предупреждение о потолке масштабирования, а для тех, кто строит решения для малых языков, — как вполне приземленная проблема доступности данных.

Почему это важно не только ученым

До недавнего времени индустрия решала языковую задачу довольно прямолинейно: больше параметров, больше данных, больше вычислений. Такой подход сработал. В 2018–2019 годах BERT и GPT-2 на архитектуре transformer показали, что статистическое обучение на гигантских текстовых массивах действительно может дать качественный скачок. После успеха ChatGPT это стало очевидно уже не только инсайдерам. Но у стратегии «просто увеличить все» есть предел. Интернет не бесконечен, и исследователи прямо говорят, что уже в 2030-х отрасль может упереться в нехватку легко доступных данных для предобучения. И вот здесь ребенок внезапно выглядит не как милый контраст для конференционного слайда, а как демонстрация альтернативного пути: оказывается, язык можно выучить, имея на руках на несколько порядков меньше примеров.

Практический смысл этого наблюдения шире, чем спор о том, у кого лучше грамматика. Если понять, за счет чего дети извлекают так много структуры из сравнительно бедного входа, это может помочь создать более экономичные модели для обучения на видео, мультимодальных данных и доменах, где корпуса невелики. Для бизнеса это означает потенциально более дешевые и специализированные системы. Для разработчиков — шанс уйти от бесконечной гонки за GPU и лицензиями на датасеты. Для рынков с меньшими языковыми сообществами — возможность строить чат-ботов и ассистентов без необходимости сначала «соскрести» половину интернета. Иными словами, вопрос о детской речи постепенно превращается в вопрос о будущей себестоимости ИИ-продуктов.

Старый спор, который снова стал инженерным

У этой дискуссии длинная история. В 1950-х Ноам Хомский выступил против бихевиористского взгляда Б. Ф. Скиннера, согласно которому язык усваивается через среду, подкрепление и повторение — примерно как собака осваивает команду за лакомство. Хомский утверждал, что одного опыта недостаточно: ребенок получает слишком мало и слишком «шумного» материала, чтобы самостоятельно вывести всю сложную синтаксическую систему языка. Этот аргумент известен как poverty of the stimulus — «бедность стимула». Из него выросла идея, что у человека есть врожденная предрасположенность к грамматике. Американская лингвистика десятилетиями жила под сильным влиянием этой школы, а ранний ИИ охотно перенял и правилоцентричный подход: если язык сложен, значит, его надо явно описать правилами и встроить в программу.

Проблема в том, что символический ИИ так и не научился уверенно работать с живым человеческим языком в реальном масштабе. Затем случилась долгая зима AI, а позже вернулись нейросети. Они не получили врожденной грамматики, зато получили дешевеющее железо, большой интернет и способность вытаскивать статистические закономерности из огромных корпусов. Сегодня LLM выглядят как серьезный контраргумент строгому тезису о том, что язык нельзя выучить на статистике. Но окончательно спор они не закрыли. Да, машины заговорили. Нет, они не объяснили, почему ребенок справляется с задачей несоизмеримо экономнее. И в этом есть почти ироничный поворот: индустрия построила системы, которые убедительно имитируют язык, но все еще не понимает, как именно тот же трюк без дата-центра проделывает младенец.

Для IT-рынка отсюда следует довольно трезвый вывод. Следующий прорыв в ИИ может прийти не из еще более тяжелой модели и не из еще одного рекорда по объему предобучения, а из архитектур и методов, которые научатся извлекать структуру из малых данных так, как это делают дети. Если такой сдвиг произойдет, он ударит сразу по нескольким фронтам: изменит экономику AI-разработки, снизит зависимость от гигантских корпусов и даст шанс языкам и продуктам, которые сейчас проигрывают не по качеству идеи, а по объему доступного текста. Пока же у отрасли остается неудобный ориентир: трехлетний ребенок все еще показывает класс там, где модели требуют целый лес серверов и почти весь интернет впридачу.

Поделиться: Telegram X LinkedIn