В одном тесте на программирование Claude Fable стоил $9, а GPT-5.5 — $1,50. Этот разрыв превращает выбор модели ИИ из вкусовщины в вполне приземлённую инженерную задачу: для русскоязычных команд это уже не вопрос «что умнее», а вопрос «что окупается в проде и не раздувает счёт».
Об этом пишет The New Stack в материале Мэттью Бёрнса, Chief Content Officer компании Insight Media Group. Главная мысль проста и неприятна для всех, кто ещё выбирает LLM по скриншотам из соцсетей: эпоха одной «лучшей модели на все случаи» заканчивается. Если в одном coding-тесте разница в цене между Claude Fable и GPT-5.5 составила шесть раз, значит, сама практика работы с генеративным ИИ меняется. Побеждает не та команда, которая взяла самый громкий бренд, а та, которая научилась быстро решать, какой модели отдать какую задачу.
Сам факт сравнения важнее, чем локальный счёт $9 против $1,50. Внутри компании эти цифры мгновенно масштабируются. Один дорогой прогон можно пережить. Сто, тысяча или десять тысяч прогонов в неделю уже превращают красивую демку в строку бюджета, на которую CFO смотрит без всякой романтики. Для разработчиков и тимлидов это означает новую рутину: считать стоимость не только токена или подписки, но и результата. Если модель пишет код чуть лучше, но обходится кратно дороже, надо понимать, где эта разница реально отбивается: в скорости релиза, в снижении числа багов, в качестве рефакторинга или хотя бы в уменьшении времени review. Если не отбивается, это уже не «премиум-модель», а просто дорогая привычка.
На этом фоне выражение model triage, которое вынесено в заголовок статьи, звучит не как красивый журналистский трюк, а как новый базовый навык AI-команд. По сути, речь о сортировке задач. Одну модель имеет смысл отправлять на сложные архитектурные или исследовательские запросы, другую — на рутинную генерацию, третью — на дешёвые массовые операции, где цена ошибки ниже, а объём выше. Такой подход давно знаком инфраструктурным и backend-командам: никто не запускает весь стек на самом дорогом ресурсе просто потому, что он мощнее. С LLM рынок пришёл к тому же выводу, только чуть позже и под более модным названием.
Контекст здесь очевиден. Последние месяцы AI-рынок жил в логике гонки качеств: кто лучше пишет код, кто реже галлюцинирует, кто дольше держит контекст, кто аккуратнее работает с агентными сценариями. Но по мере того как модели становятся частью повседневной разработки, на первый план выходят уже не только бенчмарки, а экономика использования. Для бизнеса это особенно чувствительно в двух случаях. Первый — агентные пайплайны, где одна задача разбивается на серию вызовов модели и стоимость незаметно распухает по дороге. Второй — внутренние инструменты для разработчиков, аналитиков, саппорта или HR, где число обращений быстро вырастает на порядок и любая ошибка в выборе модели ИИ множится на весь штат.
Для инженерных команд из этого следует довольно практичный вывод: сравнивать модели нужно не в вакууме, а в своих сценариях. Не «какая модель лучше кодит вообще», а «какая модель лучше закрывает именно наш тип задач за приемлемые деньги». Причём считать придётся не только прямую стоимость вызова. В расчёт входят latency, число повторных прогонов, потребность в верификации, вероятность того, что результат придётся дописывать руками, и даже цена контекстного окна, если речь идёт о большом кодовом основании. На бумаге более дешёвая модель может проиграть, если она заставляет инженера трижды переписывать запрос. Но и обратная история встречается не реже: дорогая модель показывает красивые единичные результаты, а в серийной эксплуатации оказывается роскошью без экономического смысла.
Для русскоязычного рынка тут есть ещё один слой. Многие команды уже работают в режиме сложной сборки из нескольких провайдеров, прокси, корпоративных ограничений и самописных обвязок. В такой среде выбор модели ИИ почти неизбежно становится частью архитектуры продукта, а не просто настройкой в интерфейсе. Возникают вопросы маршрутизации запросов, правил fallback, лимитов на дорогие вызовы, политик для разных ролей в команде и нормального внутреннего мониторинга. Иными словами, рядом с prompt engineering окончательно встаёт другая дисциплина: экономический orchestration моделей. Не самая романтичная часть AI-революции, зато именно она отвечает за то, будет инструмент жить в компании долго или умрёт после первого счёта.
История с $9 за один coding-тест против $1,50 у конкурента вряд ли останется одиночным курьёзом. Скорее это ранний сигнал более взрослого этапа рынка, где выбирать придётся не между «умной» и «неумной» моделью, а между разными профилями цены, качества и применимости. И если раньше главным навыком было вообще встроить LLM в рабочий процесс, то теперь всё чаще выигрывают те, кто умеет вовремя задать менее эффектный, но более полезный вопрос: действительно ли этой задаче нужна самая дорогая модель.