OpenAI представила новую модель GPT-5.5, которая показала лучшие результаты в бенчмарке SWE-rebench. Эта версия не только эффективнее решает задачи программирования, но и требует меньше токенов по сравнению с другими моделями.
Достижения GPT-5.5 в тестах
По данным SWE-rebench, GPT-5.5 решает 58,9% задач при стоимости 0,98 доллара, в то время как её ближайший конкурент, Claude Opus 4.8, достигает лишь 52,4% при почти такой же цене. При этом расход токенов на задачу составляет 0,71 миллиона для GPT-5.5, в то время как у Opus 4.8 - 1,01 миллиона токенов.
Оптимизация и стабильность моделей
Сравнение с предыдущими версиями показывает, что переход от Opus 4.7 к 4.8 привёл к снижению расхода токенов с 1,53 до 1,01 миллиона, а стоимость решения — с 1,32 до 0,94 доллара, хотя доля решённых задач смогла увеличиться лишь незначительно. Обновлённая модель делает акцент на стабильность, что становится важным в контексте надёжности решений.
Также в тестах учитывается метрика pass^5: GPT-5.5 теперь реже ошибается в решении задач и выдаёт воспроизводимые результаты, что критично для агентных сценариев.
Выводы для российских разработчиков
Для разработчиков в России результаты новой модели важны. Увеличение стабильности и эффективности позволяет оптимизировать затраты на использование нейросетей. Существует возможность снижения бюджета на токены до 30%, что позитивно скажется на копеечных проектах.
Следующий шаг для OpenAI — возможное обновление, которое может ещё больше увеличить эффективность модели в будущих релизах.