AI И НЕЙРОСЕТИ

«Пещерные» промпты не спасают: где на самом деле горят токены

Восемь моделей на пяти датасетах показали: сжатие пользовательских промптов не экономит токены, а часто повышает итоговую стоимость работы ИИ.

✍️ Редакция iTech News | 07.07.2026 | ⏱ 4 мин | Источник: The New Stack
🤖

Восемь моделей, пять датасетов и пять уровней сжатия дали неприятный для любителей «пещерных» промптов вывод: экономия токенов может оказаться миражом. Если сокращать именно пользовательский запрос до уровня «я хотеть код», итоговая стоимость работы модели нередко не падает, а растет — и для русскоязычных команд, которые уже считают бюджет на AI coding tools, это куда важнее очередного лайфхака из соцсетей.

Об этом сообщает The New Stack, разбирая свежую работу CAVEWOMAN о том, как большие языковые модели ведут себя при сжатии входного и выходного текста. Главная мысль довольно приземленная, но полезная: экономия токенов зависит не от того, насколько смешно или телеграфно вы сформулировали задачу, а от того, какой именно канал вы сжимаете. И вот тут начинается расхождение между интернет-мифом и практикой.

Исследование, опубликованное на arXiv 23 июня 2026 года, подготовили Morayo Danielle Adeyemi, Ryan A. Rossi и Franck Dernoncourt. Авторы проверили восемь моделей на пяти датасетах и пяти уровнях сокращения текста. Результат получился почти издевательским по отношению к бытовой логике «меньше слов — меньше счет». Когда сжимали ответы модели, стоимость на большинстве API-моделей действительно снижалась: в среднем в 1,4-2,4 раза, а в лучшем случае — до 3 раз. Но когда урезали именно входной промпт, происходило обратное: средняя итоговая стоимость вырастала примерно в 1,15 раза, на худшем датасете — до 1,8 раза, а при более агрессивном сжатии — до 2,7 раза.

Причина не в какой-то магии токенизатора, а в поведении самой модели. Короткий и примитивный запрос не обязательно делает задачу для LLM проще. Наоборот, модель часто начинает «додумывать» недостающий контекст, отвечает длиннее, тратит больше токенов и при этом заметно хуже попадает в цель. Авторы прямо называют такое сжатие lose-lose-сценарием: вы одновременно платите больше и получаете слабее результат. Для разработчиков это особенно неприятно, потому что иллюзия экономии обычно появляется именно там, где расходы уже под контролем менеджмента: в агентных IDE, кодогенерации, ревью, автоматических тестах и внутренних copilot-инструментах.

Есть и второй слой проблемы, уже не про бухгалтерию, а про качество. Исследователи отмечают, что на нерезонинговых моделях примерно половина ответов могла оставаться формально корректной, но текст при этом переставал совпадать по смысловой поверхности с нормальной, несжатой версией ответа той же модели. Проще говоря, система иногда все еще решает задачу, но делает это в куда более нестабильной и труднопредсказуемой форме. Для бытового запроса это терпимо. Для кода, инфраструктурных изменений или генерации SQL уже нет: вам нужен не просто «какой-то рабочий результат», а воспроизводимый и понятный результат, который не расползается от мелкой правки промпта.

На этом фоне популярный совет заставить AI-помощника говорить и думать «как пещерный человек» выглядит типичным артефактом раннего рынка. Пока компании массово внедряют Claude Code, GitHub Copilot, Cursor-подобные сценарии и собственных агентов поверх API, рынок одновременно ищет два коротких пути: поднять качество и снизить чек. Желательно одной строчкой в system prompt. Но статья The New Stack довольно внятно показывает, почему такие трюки плохо переживают встречу с цифрами. У моделей нет встроенного уважения к человеческой интуиции про длину фразы. Сократив запрос, вы не отменяете сложность задачи. Вы просто перекладываете часть работы обратно на модель — а она выставляет счет в своем формате.

Для бизнеса вывод еще прозаичнее. Настоящая экономия токенов возникает не из стилистических ужимок, а из инженерных решений: сокращения лишнего контекста, нормальной маршрутизации задач, выбора более дешевой модели там, где это допустимо, кэширования, ограничения длины ответов, разбиения пайплайна на этапы и внятных evals. Если команда тратит тысячи долларов в месяц на генерацию кода и агентные сценарии, то «говори короче» без измерений превращается в дешевую оптимизацию с дорогими последствиями. Особенно в тех случаях, где модель потом еще и сама проверяет, переписывает и объясняет собственный вывод — то есть раздувает ответную часть, которую никто не планировал.

Для русскоязычного IT-рынка здесь есть и отдельный практический нюанс. Многие команды до сих пор меряют эффективность AI-инструментов почти вручную: смотрят на подписку, лимиты и субъективное ощущение «кажется, стало дешевле». Но агентные инструменты считают не впечатления, а токены, и экономия токенов требует нормального учета. Иначе можно неделями радоваться компактным промптам, а потом обнаружить, что модель стала отвечать длиннее, ошибаться чаще, а инженер тратит больше времени на перепроверку. В результате CFO получает счет, разработчик — лишний когнитивный шум, а менеджер — иллюзию оптимизации.

Следующий этап конкуренции среди AI coding tools, похоже, будет идти уже не вокруг самых остроумных промптов, а вокруг прозрачности расходов и управляемости качества. Чем больше кода пишут агенты, тем меньше рынок готов верить в шаманство уровня «уберите артикли — и все подешевеет». Проверить исходный разбор можно у The New Stack: там как раз видно, что разговор про стоимость AI-инструментов окончательно вышел из стадии мемов и перешел в стадию измерений.

Поделиться: Telegram X LinkedIn