AI И НЕЙРОСЕТИ

В Reksoft рассказали, как оптимизация промптов снизила бюджет ИИ

Лимит в 10 000 токенов в неделю заставил инженера Reksoft пересобрать работу с LLM: оптимизация промптов снизила расходы на ИИ примерно на 50%.

✍️ Редакция iTech News | 07.08.2026 | ⏱ 5 мин | Источник: Habr / Карьера
🎯

Недельный лимит в 10 000 токенов на проекте заставил ведущего инженера по тестированию Reksoft пересмотреть работу с LLM и в итоге сократить расходы примерно на 50%. История кажется частной, но для команд, которые уже притащили генеративный ИИ в CI/CD, оптимизация промптов быстро превращается из милой привычки в вопрос бюджета, скорости и предсказуемости результата.

Об этом сообщает Habr / Карьера со ссылкой на материал Анны, ведущего инженера по тестированию в Reksoft. По ее словам, за два года работы с большими языковыми моделями они успели встроиться в повседневный стек: генерация тестов, анализ логов, рутинные проверки и подготовка рабочих артефактов. Проблема проявилась быстро: один «человеческий» запрос с приветствием, «пожалуйста» и пояснениями мог забирать около 500 токенов на входе и еще несколько тысяч на выходе. На фоне общего недельного лимита такой стиль общения с моделью выглядит уже не вежливостью, а прямой утечкой ресурса.

Дальше Анна разбирает базовую механику без магии: токен как минимальную единицу текста, эмбеддинги как числовое представление смысла и контекстное окно как аналог оперативной памяти модели. Для практики важнее всего последнее. Если окно у модели составляет, например, 8K или 128K токенов, то при переполнении она начинает терять самые старые фрагменты диалога, а пользователь замечает это не по предупреждению в интерфейсе, а по внезапному падению качества ответа или галлюцинациям. Еще один неприятный нюанс для тех, кто оплачивает API из рабочего бюджета: в стоимость запроса входит не только текущая реплика, но и история диалога, системная инструкция и загруженные документы. Модель не «помнит» PDF бесплатно и не делает скидку за то, что вы уже отправляли его вчера: если документ весил 3000 токенов, то при новом вопросе он снова окажется в счете.

Самый показательный фрагмент материала связан с языком запросов. Автор прогнала одну и ту же инструкцию для тестирования эндпоинта через токенизатор GPT-4 на базе tiktoken и сравнила русский, английский и китайский варианты. Вывод получился неприятно практичным: русский текст обходится примерно в полтора раза дороже английского, потому что длинные слова с приставками и суффиксами чаще режутся на несколько токенов. Для китайского, японского и корейского стоимость может быть еще выше, поскольку отдельные символы нередко становятся самостоятельными токенами. Для русскоязычных команд это означает простую вещь: чем разговорнее и многословнее промпт, тем быстрее улетает лимит. Отсюда и совет автора: если процесс позволяет, формулировать запросы на английском часто выгоднее и по цене, и по точности, потому что большинство массовых LLM обучались прежде всего на англоязычных корпусах.

Ключевой кейс про оптимизацию промптов автор показывает на задаче для эндпоинта /api/login. Первый вариант был написан «как человеку»: с приветствием, просьбой помочь, пояснениями про позитивные и негативные сценарии, упоминанием безопасности и свободным форматом ответа. Такой запрос занял около 350 токенов на входе, а ответ разросся примерно до 2000 токенов. Второй вариант был сухим и инженерным: пять ключевых кейсов для POST /api/login в формате Given-When-Then, включая валидный логин, невалидный пароль и SQL-инъекцию, без лишних пояснений. Цена вопроса упала до 120 токенов на входе и примерно 500 на выходе. По содержанию результат оказался сопоставимым, а по скорости лучше. Еще жестче разница проявилась на логах: длинный запрос со стектрейсом против короткой инструкции в духе «выдели только код ошибки и имя файла» дал тот же полезный результат при разнице в девять раз по входным токенам.

Из этого кейса получается набор правил, который легко перенести в командную практику. Чем конкретнее задача, тем меньше уточняющих кругов и пустых ответов. Вежливые вступления и «вода» в интерфейсе с LLM не конвертируются ни в качество, ни в эмпатию, зато исправно конвертируются в счет. Ограничение объема ответа работает не хуже лимитов на логи в проде: если не задать формат и размер, модель почти наверняка напишет больше, чем нужно. Роль и стиль лучше один раз вынести в системную инструкцию, а под новые задачи открывать отдельные чаты или подсовывать модели короткую выжимку вместо всей переписки. Это, как отдельно подчеркивает автор, не уменьшает число токенов самой системной инструкции, но экономит время и снижает соблазн повторять одно и то же в каждом запросе. Для ревью кода выгоднее отправлять функции и модули кусками, а не монолит на тысячу строк. При лимите в 10 000 токенов в неделю это уже не академическая оптимизация промптов, а обычная дисциплина расхода ресурса: либо около шестидесяти коротких запросов, либо несколько глубоких разборов, либо один очень дорогой заход по багу с документами и логами.

В собственном проекте Reksoft, по словам Анны, рабочая схема свелась к декомпозиции и шаблонам. Большие задачи разбиваются на короткие шаги: сначала выделить несколько критичных ошибок из лога, потом по каждой отдельно попросить тесты или гипотезы. Документацию выгоднее один раз сжать в краткую выжимку и потом использовать ее как контекст, чем снова и снова загружать исходный файл. Для рутинных писем и отчетов помогают заранее подготовленные промпты без лишних слов. Проверять реальный «вес» текста она советует через OpenAI Tokenizer и Hugging Face Tokenizer: иногда «короткий» вопрос на русском оказывается длиннее ожидаемого просто потому, что одно составное слово распиливается на четыре токена. Для бизнеса это уже не история про красоту формулировок, а про нормальный операционный контроль над расходами на ИИ.

Для российского IT это хороший сигнал на вырост. Пока одни спорят, какую модель подключить в продукт или внутренний контур, другие уже считают стоимость каждой лишней фразы и перестраивают процессы под ограничения контекста. Если LLM остаются в разработке, тестировании и аналитике надолго, то спор скоро сместится с выбора модели на более приземленный вопрос: кто в команде умеет говорить с ней коротко, точно и дешево.

Поделиться: Telegram X LinkedIn