Anthropic выпустила обновление Claude Opus 4.8, которое сокращает количество незамеченных ошибок в коде в 4 раза по сравнению с предыдущей версией. Эта версия стоит столько же, сколько и предшественница — $5 за миллион входных токенов и $25 за миллион выходных токенов.
Общие улучшения модели
По словам создателей, обновление невозможно назвать революционным, однако оно всё равно отображает серьёзные изменения в подходе к обучению модели. Новая версия моделирует честность в выводах — вместо того, чтобы уверенно утверждать, модель теперь чаще признаёт свои ограничения и замечает ошибки в написанном коде.
По данным компании, прямо сейчас модель Opus 4.8 обращает внимание на свои ошибки и реже выдает необоснованные утверждения, что значительно улучшает её надёжность. В сравнении с результатами Opus 4.7, на тестах SWE-Bench Pro (агентное программирование) новая версия набирает 69,2% и 83,4% на OSWorld-Verified (управление компьютером).
Позиция на рынке
Хотя модель всё ещё уступает GPT-5.5 в проектировании кода на ряде проверок, в целом Opus 4.8 сделала шаг вперед. Например, на тестах по управлению компьютером она выдает 83,4% точности, но пока проигрывает по этому же методу предыдущему GPT-5.5, который показал 83,4%. Тем не менее, на SWE-Bench Pro её результат опережает Opus 4.7 на 5%.
Кроме того, Anthropic подчеркивает, что новая модель заметно уменьшила случаи «несогласованного поведения», что делает её более безопасной для использования. Например, по показателю, который служит индикатором её склонности к обману, Opus 4.8 почти сравнялась с экспериментальной моделью Claude Mythos Preview.
Что это значит для разработчиков
Для разработчиков важным аспектом становится надежность модели. Стремление к улучшению качества кода и уменьшению ошибок делает Claude Opus 4.8 более привлекательной для использования в сферах, где критично важна точность — например, в программировании и AI-решениях, требующих высокой степени уверенности. Применение этой модели может сократить время на исправление багов и повысить эффективность разработки программного обеспечения.
Следующий шаг для Anthropic заключается в поддержании этой динамики улучшений и возможном расширении функционала модели к более сложным задачам в ближайших релизах.