АНАЛИТИКА

Claude Opus 4.8 сделал ИИ умнее, но счет за токены стал больнее

28 мая Anthropic выпустила Claude Opus 4.8: модель стала мощнее, но вместе с dynamic workflows резко обострила вопрос стоимости токенов.

✍️ Редакция iTech News | 31.05.2026 | ⏱ 5 мин | Источник: The New Stack
📊

28 мая Anthropic выпустила Claude Opus 4.8, и почти сразу стало ясно: главный апгрейд здесь не только в качестве модели, но и в цене ошибок. Если раньше перерасход на ИИ можно было списать на этап экспериментов, то теперь дисциплина токенов превращается в норму для команд, которые реально внедряют агентные сценарии в разработку и бизнес-процессы.

Как пишет The New Stack, Opus 4.8 получил сразу несколько улучшений, которые выглядят как подарок для инженерных команд: новый контроль effort, более дешевый fast mode и dynamic workflows, где Claude Code может сам планировать задачу и запускать сотни параллельных субагентов в рамках одной сессии. На бумаге это звучит как следующий шаг к большим автономным пайплайнам: миграции кода, крупные рефакторинги, многошаговые изменения в больших репозиториях. Но в такой архитектуре каждая дополнительная ветка рассуждений и каждый субагент включают собственный счетчик токенов. И чем умнее становится модель, тем проще сжечь бюджет не из-за багов, а из-за чрезмерной амбиции.

В колонке The New Stack приводится показательный пример из вирусного теста разработчика: на одном и том же тикете среднего размера Opus 4.8 в режиме максимального effort якобы израсходовал 16,5 млн токенов и обошелся в 17,26 доллара, тогда как GPT-5.5 справился с задачей за 5,9 млн токенов и 5,57 доллара. Даже если не превращать один бенчмарк в абсолютную истину, порядок цифр неприятный. Разница не в процентах, а почти втрое по стоимости. Для одиночного разработчика это повод задуматься, для компании с десятками команд и автоматизированными агентами это уже вопрос не удобства, а финансовой гигиены.

Именно поэтому релиз Opus 4.8 в статье подается не как история про очередную модель, а как симптом более крупного разворота рынка. Несколько недель назад внутри больших компаний, по словам автора, модно было заниматься tokenmaxxing: демонстративно наращивать потребление токенов как метрику собственной "AI-продвинутости". Теперь эта мода начинает выглядеть как корпоративная версия бессмысленного бенчмаркинга. Fortune со ссылкой на Джереми Кана писал, что такие практики упираются в старую проблему Goodhart’s Law: как только метрика становится целью, она перестает быть полезной метрикой. В статье приводятся и более конкретные эпизоды: Amazon, как сообщается, убрала внутренний лидерборд Kirorank после того, как сотрудники начали скармливать агентам бессмысленные задачи ради роста в рейтинге; Meta, по данным автора, также отказалась от похожего табло.

На этом фоне истории о завышенных расходах на ИИ перестали выглядеть экзотикой. The New Stack пересказывает публикации Axios о том, что компании сталкиваются с AI sticker shock, то есть банальным шоком от счетов. Один из самых громких эпизодов недели был связан с неподтвержденной историей о клиенте, который якобы потратил на Claude полмиллиарда долларов за месяц из-за отсутствия лимитов на корпоративные лицензии. Автор колонки отдельно подчеркивает: этот кейс не верифицирован, и относиться к нему как к установленному факту нельзя. Но показательно другое: рынок мгновенно поверил, что подобный сценарий в принципе возможен. Это и есть главный сдвиг. Никто уже не спорит о том, может ли ИИ быть полезным. Спор теперь о том, кто сумеет встроить его так, чтобы выгода не растворилась в токенах.

Для разработчиков и руководителей здесь важна неприятная, но практичная мысль. Новые возможности вроде dynamic workflows делают Claude Code сильнее именно там, где бюджеты раздуваются быстрее всего: длинные сессии, параллельные агенты, многошаговые изменения и высокий effort. Иначе говоря, продукт становится ценнее ровно в тех сценариях, где дисциплина токенов нужна жестче всего. Если раньше команда могла просто выбрать самую сильную модель и жить с этим решением, то теперь такой подход начинает напоминать поездку по городу на спорткаре с расходом как у грузовика. Да, доедете быстро. Но вопрос, зачем и за чей счет.

В колонке есть и более конструктивная линия: победят не те, кто просто покупает доступ к флагманским моделям, а те, кто научится маршрутизировать запросы. The New Stack ссылается на слова CEO Factory Матана Гринберга: для множества задач Opus вообще не нужен. По данным, которые приводит издание, использование открытых моделей в Factory за последний месяц утроилось относительно закрытых. Логика здесь прозрачная и уже знакомая зрелым инженерным командам: дорогую frontier-модель стоит вызывать только там, где более дешевый или открытый вариант действительно не вытягивает качество, скорость или надежность. Все остальное должно уходить на более дешевые модели, специализированные агенты или self-hosted-сценарии.

Показателен и пример Mate Security, который автор анонсирует через разговор с сооснователем компании Асафом Винером, выходцем из Wiz. По его словам, после почти критичного счета за инференс выбор модели в компании опустили ближе к тем, кто реально пишет функциональность. Теперь backend-инженеры сами пишут evals и решают, какую модель направить на конкретную нагрузку, включая open source-модели на собственных GPU. Формула грубая, но честная: инженеры больше не просто пишут код, они оркестрируют агентов и отвечают не только за результат, но и за стоимость этого результата. Для русскоязычной аудитории это, пожалуй, самая полезная часть всей истории. Проблема уже не в том, какую модель поставить в демо, а в том, кто внутри команды имеет право и обязанность управлять ценой inference.

На этом фоне Opus 4.8 выглядит не просто сильным релизом Anthropic, а маркером взросления всего рынка. Чем лучше становятся модели, тем опаснее иллюзия, что можно бездумно дать им максимум свободы и потом удивляться счетам. Следующий этап конкуренции между AI-платформами, похоже, пройдет не только по качеству ответов, но и по тому, насколько прозрачно они позволяют держать под контролем effort, маршрутизацию и стоимость каждого агентного шага. И если дисциплина токенов действительно заменит показное tokenmaxxing, то выиграют не самые шумные пользователи ИИ, а самые трезвые.

Поделиться: Telegram X LinkedIn