КИБЕРБЕЗОПАСНОСТЬ

Claude Sonnet 5.5 получил предохранители для киберзапросов

28 сентября Anthropic выпустила Claude Sonnet 5.5: модель быстрее Sonnet 5 более чем на 30%, но часть киберзапросов уйдет на fallback.

✍️ Редакция iTech News | 29.09.2026 | ⏱ 4 мин | Источник: The New Stack
🦠

Claude Sonnet 5.5 вышел с необычной оговоркой: пользователь может выбрать новую модель, но часть запросов по кибербезопасности Anthropic автоматически отправит на Sonnet 5. Для разработчиков, security-команд и компаний, которые уже встраивают LLM в рабочие процессы, это важный сигнал: мощные модели становятся не просто тарифной опцией, а управляемой средой с собственными правилами допуска.

Релиз состоялся в понедельник, 28 сентября 2026 года, сообщает The New Stack. По заявлению Anthropic, это первая модель семейства Sonnet, которая стартует с киберзащитой и механизмом fallback, ранее характерным для более мощных моделей компании. Если классификаторы сочтут запрос слишком рискованным с точки зрения offensive security, ответ может быть сгенерирован не выбранной моделью, а Sonnet 5. Переключение обещают делать видимым для пользователя.

На бумаге новая модель выглядит как прагматичный апгрейд, а не как демонстрация ради демонстрации. Anthropic пишет, что Sonnet 5.5 генерирует ответы более чем на 30% быстрее Sonnet 5 и при этом стоит столько же по базовому прайсу: 2 доллара за миллион входных токенов, 10 долларов за миллион выходных токенов и 0,20 доллара за миллион токенов чтения из кэша. За счет меньшего числа токенов на типовую задачу компания обещает до 30% экономии на задачу, хотя реальная цифра, конечно, будет зависеть от сценария, промптов и того, насколько часто срабатывают ограничения.

В бенчмарках Anthropic делает акцент на задачах, близких к повседневной работе инженеров. На Terminal-Bench 4.0, тесте для агентного программирования, модель набрала 70,6% против 10,3% у Sonnet 5. На GDPval-AA, оценке выполнения рабочих задач из разных профессий, она, по данным компании, отстает от Opus 5.5 на два пункта. Отдельно Anthropic упоминает long-horizon-задачи, работу с изображениями и даже прохождение Pokémon Red только по скриншотам. Последний пункт звучит как игрушка, но для агентных систем это вполне узнаваемый тест на устойчивость: модель должна помнить состояние, планировать и не разваливаться через несколько шагов.

Главная интрига релиза не в скорости, а в границе между полезной автоматизацией и контролем доступа. Anthropic заявляет, что кибервозможности Sonnet 5.5 приблизились к уровню Opus 5, поэтому модель получила похожие защитные механизмы. Рутинная разработка, поиск багов в собственном коде, triage уязвимостей и secure coding должны работать без изменений. Но запросы, похожие на генерацию эксплойтов, продвинутый пентест или другие высокорисковые операции, могут быть перенаправлены на менее способную модель. Для легитимных защитников компания обещает расширенную Cyber Verification Program с многоуровневым доступом к возможностям Sonnet 5.5, Opus 5.5 и Claude Mythos.

Это меняет ожидания от LLM в инженерной инфраструктуре. Раньше команда могла обсуждать модель как набор параметров: цена, latency, качество кода, контекст, стабильность API. Теперь в список придется добавлять поведение safety-слоя. Если агент пишет тесты, чинит CI и рефакторит сервисы, все скучно и хорошо. Если тот же агент анализирует бинарник, строит proof-of-concept для уязвимости или помогает red team, часть сценариев может уйти в fallback, а часть потребует верификации аккаунта. Для бизнеса это не философия, а эксплуатационный риск: пайплайн может внезапно получить ответ от другой модели, а значит, нужны логи, метрики, повторяемость и понятные правила обработки таких случаев.

Есть и второй пласт — защита от извлечения возможностей модели. Sonnet 5.5 стала первой моделью Sonnet, которую Anthropic запускает с классификаторами против distillation-атак, где злоумышленники массово используют аккаунты для копирования поведения модели. Компания также говорит о расширении механизма preserved thinking: внутренние рассуждения нельзя просто отделить от аккаунта и перенести в другой контекст. Большинство разработчиков, вероятно, этого не заметят. Зато команды, которые переносят диалоги между аккаунтами или переключают учетные записи в Claude Code, могут столкнуться с новыми ограничениями.

Для русскоязычных IT-команд вывод довольно прямой: Claude Sonnet 5.5 выглядит сильным кандидатом для повседневного кодинга, агентных задач и документной работы, но security-сценарии теперь нужно проектировать с учетом автоматического переключения модели. Чем мощнее LLM становится в инженерных задачах, тем меньше она похожа на обычный API-эндпоинт. Скорее это уже регулируемый исполнитель: быстрый, полезный, местами очень способный, но с дверями, которые открываются не всем и не всегда.

Поделиться: Telegram X LinkedIn