АНАЛИТИКА

Дешевые AI-модели могут сломать экономику рынка ИИ

80% AI-нагрузок могут уйти на модели на 99% дешевле уже за 12–18 месяцев, и это меняет экономику ИИ для разработчиков и бизнеса.

✍️ Редакция iTech News | 10.06.2026 | ⏱ 5 мин | Источник: TechCrunch
📐

80% AI-нагрузок могут перейти на модели, которые дешевле на 99%, в течение ближайших 12–18 месяцев. Если этот сценарий сработает, дешевые AI-модели ударят не только по привычке брать «самое мощное», но и по экономике всего рынка: для команд это шанс резко снизить стоимость инференса, а для крупных лабораторий — риск недополучить выручку там, где раньше деньги текли почти по инерции.

Об этом сообщает TechCrunch в материале о том, как рынок начинает смотреть не на максимальный интеллект модели, а на цену ответа при приемлемом качестве. Формула, на которой держался AI-бум, была простой: чем модель больше, тем она сильнее, а значит, именно она и должна выигрывать. Теперь у бизнеса появился неприятный, но очень практичный вопрос: зачем платить за флагман там, где задачу закроет модель попроще?

Не гонка за максимумом, а охота за достаточностью

Повод для разговора дал сооснователь Coinbase Брайан Армстронг. По его оценке, спрос на «интеллект» почти бесконечен, но уже в горизонте 12–18 месяцев до 80% рабочих нагрузок могут оказаться на моделях, которые стоят на 99% дешевле, чем передовые варианты. Оставшиеся 20% — там, где действительно нужен максимум качества: сложный анализ, критичные рассуждения, дорогие ошибки. Это не просто спор о ценниках. Если большая часть прикладных сценариев и правда поедет на более дешевой модели без заметной просадки по качеству, крупные AI-лаборатории окажутся в ситуации, когда продавать «премиальный интеллект» придется сильно реже.

На практике первые сигналы уже есть. Юридический AI-сервис Harvey провел тест вместе с Fireworks AI и смог сократить стоимость инференса в три раза без потери качества. Схема была гибридной: для самых тяжелых задач оставляли Claude Opus, а часть нагрузки уводили на GLM 5.1, который доступен через Fireworks. В переводе с маркетингового на инженерный это означает простую вещь: не каждая задача требует модели из верхней полки, если маршрутизация устроена нормально. Сооснователь Harvey Гейб Перейра сформулировал это довольно точно: качество в юрсервисах остается главным, но само понятие качества меняется — теперь важно не использовать самую мощную модель на все случаи жизни, а выбрать ту, которая дает правильный ответ наиболее эффективно.

Это, пожалуй, и есть главный разворот 2026 года. Раньше корпоративный заказчик чаще мыслил по логике «берем лучшее из доступного, потому что ошибка обойдется дороже». Такая логика поддерживалась и тем, что стоимость AI во многом была завуалирована: цены выглядели терпимо, а часть экономики держалась на щедрости инвесторов и субсидировании роста. Пока рынок жил в режиме «захватить долю любой ценой», у клиентов почти не было причин экономить. Теперь этот комфорт заканчивается: токены дорожают, субсидии уже не выглядят бесконечными, а CFO снова спрашивает, почему простая автоматизация саппорта внезапно стоит как небольшой отдел разработки.

Что это меняет для разработчиков и компаний

Важно и то, что TechCrunch предлагает смотреть не на привычную ось «закрытые модели против open-weight» или «американские против китайских», а на другое разделение: большие модели против маленьких. Для бизнеса это куда полезнее. Экономия может прийти и при переходе с флагманской закрытой модели на более дешевую альтернативу от другого поставщика, и при переходе на более компактную модель внутри того же вендора. Иначе говоря, для бюджета не так важно, кто именно победит в этой категории. Важнее, что сама идея «по умолчанию ставим самый мощный движок» перестает быть нормой.

Для разработчиков это означает рост интереса к оркестрации, маршрутизации запросов и более аккуратной архитектуре AI-продукта. Простой вызов одной дорогой модели на любой чих выглядел удобно, когда стоимость ошибки в выборе модели не считали всерьез. Теперь считать будут. Выигрывать начнут не только лаборатории, которые тренируют очередной гигантский frontier-модель, но и команды, умеющие правильно разнести нагрузку: легкие задачи отправлять на дешевые AI-модели, тяжелые — на более дорогие, а часть запросов вообще отсекать до вызова LLM. Это уже не «оптимизация потом», а часть продукта.

Для продактов и IT-директоров вывод еще жестче. Если сценарий с 80% нагрузок на дешевых моделях подтвердится хотя бы частично, пересматривать придется и юнит-экономику AI-функций, и логику закупок, и KPI поставщиков. На рынке, где раньше продавали прежде всего качество как абсолют, начнут чаще продавать соотношение цены и достаточного результата. Это меняет переговорную позицию клиентов. Если раньше аргумент вендора звучал как «наша модель умнее», то теперь ответ может быть очень приземленным: «умнее на сколько, и сколько это стоит на миллион запросов?» Для стартапов это вообще шанс войти в сделки, где их раньше не ждали: не потому что у них лучший интеллект, а потому что у них лучшая экономика.

При этом есть и более неприятный для рынка вариант. Компании могут не перейти на маленькие модели, а просто урезать потребление: меньше запросов, меньше контекста, меньше пилотов, меньше сомнительных внедрений. Такой сценарий тоже бьет по спросу на инференс, а значит, и по ожиданиям от рынка, который долго жил на предпосылке, что потребление вычислений будет расти почти автоматически. Если выяснится, что значимую долю реальных задач можно закрывать намного дешевле, индустрии придется заново объяснять, зачем тратить все больше на обучение новых frontier-моделей и где именно окупается этот потолок качества.

Ближайшие месяцы, похоже, сведут спор об ИИ к довольно земной развилке: пользователю нужен максимальный интеллект или просто надежный ответ по адекватной цене. И если рынок массово выберет второе, главным событием года станет не еще одна рекордная модель, а тихий переезд AI-нагрузок на более скромные и прагматичные системы. Проверить исходные цифры и цитаты можно в материале TechCrunch.

Поделиться: Telegram X LinkedIn