Claude Opus 5.5 вышел 22 сентября и должен был стать практичной заменой более тяжелым моделям Anthropic: почти уровень Fable 5.1, ниже стоимость, тот же миллион токенов контекста. Но в тестах на разработческих задачах картинка получилась менее рекламной: дешевле — да, надежнее — не всегда.
В сравнении, которое провела Jessica Wachtel, сообщает The New Stack, две модели прогнали через три типа задач по пять раз каждую: агентное исправление багов, реализацию resolver-спецификации и поиск ошибок конкурентного выполнения. Итог выглядит как хороший повод не менять модель в продакшене по одному пресс-релизу. Fable 5.1 выдал 15 идеальных прогонов из 15, Claude Opus 5.5 — 13 из 15.
На бумаге Opus 5.5 выглядит почти слишком удачно. Anthropic позиционирует его как модель для большинства рабочих сценариев и заявляет, что она близка к Fable 5.1 на основной массе задач. У обеих моделей заявлено окно контекста в 1 млн токенов и максимальный вывод до 128 тыс. токенов. При этом Opus 5.5 стоит $4 за миллион входных токенов и $20 за миллион выходных, а Fable 5.1 — $10 и $50 соответственно. Для команд, которые уже считают стоимость каждого агентного запуска, разница не косметическая.
Но тесты показали, что цена за токен — только половина истории. В сумме за 15 прогонов Opus 5.5 обошелся в $22,07, Fable 5.1 — в $28,14. Экономия составила примерно 22%. Звучит приятно, пока не смотришь на время и объем вывода: Opus 5.5 занял 2 часа 28 минут 39 секунд против 1 часа 29 минут 14 секунд у Fable 5.1 и написал в 2,2 раза больше выходных токенов. То есть более дешевая модель компенсировала тариф своей многословностью и осторожностью. Иногда это полезно. Иногда это просто счетчик крутится.
В первом задании, где модели исправляли баги в агентном режиме, обе показали 5 из 5 идеальных прогонов. Здесь Opus 5.5 даже выглядел выгоднее: среднее время 3 минуты 21 секунда, 20 625 выходных токенов, 25 вызовов инструментов и $0,75 за серию. Fable 5.1 справился быстрее — 2 минуты 37 секунд — и короче: 11 381 выходной токен, 22 вызова инструментов, но стоил $1,50. Для типичного CI-сценария это тот случай, когда Opus можно брать как рабочую лошадку: чуть болтливее, зато дешевле и без потери качества в этом конкретном классе задач.
Во втором тесте, с resolver-спецификацией, обе модели снова прошли все пять прогонов без ошибок. Разница оказалась в стиле работы. Opus 5.5 потратил в среднем 9 минут 40 секунд и выдал 70 687 токенов, Fable 5.1 — 6 минут 46 секунд и 38 710 токенов. Стоимость: $1,42 против $1,96. Для продуктовой команды это неприятный компромисс: можно сэкономить, но получить более длинный цикл ожидания и больше текста, который потом все равно должен прочитать человек или следующий агент.
Самый показательный разрыв случился на задачах с конкурентностью. Fable 5.1 сделал 5 из 5 идеальных прогонов, Opus 5.5 — только 3 из 5. В двух случаях Opus уперся в лимит и фактически не вернул полезный результат. Среднее время у него выросло до 16 минут 43 секунд, объем вывода — до 111 428 токенов, стоимость — до $2,24. Fable 5.1 уложился в 8 минут 27 секунд, 43 001 токен и $2,17. Здесь более дорогая модель внезапно оказалась не только точнее и быстрее, но и чуть дешевле по фактической стоимости задачи, потому что не раздувала рассуждение до потолка.
Для разработчиков вывод довольно приземленный. Claude Opus 5.5 можно ставить первым кандидатом на массовые задачи: исправление багов, генерацию кода, ревью, работу с понятными спецификациями. Но для задач, где ошибка проявляется только при гонках, неочевидных состояниях или длинной цепочке зависимостей, Fable 5.1 пока выглядит спокойнее. Не потому, что у него красивее название, а потому что он меньше теряет фокус там, где модель должна удерживать несколько причинно-следственных нитей одновременно.
Для бизнеса это еще один аргумент против выбора AI-модели по бенчмарку из презентации. На реальных задачах важна не только цена миллиона токенов, но и число попыток, среднее время до пригодного результата, риск пустого ответа, нагрузка на ревьюера и поведение модели при исчерпании контекста. Если агент пишет в два раза больше, работает на 67% дольше и иногда возвращает ничего, экономия на тарифе быстро становится бухгалтерской иллюзией с техническим долгом в подарок.
Похоже, ближайшая практика для инженерных команд будет гибридной: Claude Opus 5.5 — как дефолт для большинства задач, Fable 5.1 — как эскалация для сложных рассуждений, конкурентности и длинных агентных цепочек. Полные таблицы прогонов опубликованы в ; главный вопрос теперь не в том, какая модель «умнее», а в том, умеет ли ваша система маршрутизации вовремя понять, когда дешевый исполнитель начал слишком долго думать.