Исследователи из Карнеги-Меллон под руководством Дэвида Брамли представили тест ExploitBench, который продемонстрировал, что искусственный интеллект Claude Mythos смог разработать 18 рабочих эксплойтов для уязвимостей в движке V8, используемом в браузерах Chrome и Edge. Для разработчиков это весомый повод задуматься о безопасности веб-технологий.
Контекст исследования
ExploitBench включает в себя 41 уязвимость, оцененную на способности девяти фронтир-моделей искусственного интеллекта находить и использовать их. Из всех протестированных моделей только Claude Mythos смог превратить уязвимости в реальные эксплойты. Остальные модели, такие как Opus 4.7, Sonnet 4.6, Haiku 4.5 и другие, не смогли достичь даже одного рабочего эксплойта.
Исследование показало, что, несмотря на то, что другие модели могут находить ошибки, их возможности по эксплуатации уязвимостей ограничены. Как показали тесты, они смогли лишь «падать» при возникновении ошибок, но для реальной атаки это недостаточно.
Путь к успешной эксплуатации
Находящийся под контролем исследователей Claude Mythos смог пройти через пять уровней сложности, включая доступ к памяти и захват управления процессором. Все девять моделей достигли лишь третьего уровня, что подтверждает отсутствие прогресса у открытых моделей в сравнении с закрытым решением Anthropic.
Claude Mythos смог реализовать атаки на основе багов в WebAssembly и JIT-компиляторе, что позволяет ставить под сомнение безопасность не только браузеров, но и всей системы в целом. Это является серьезным звоночком для разработчиков программного обеспечения и ИТ-компаний.
Значение для разработчиков
Для российской ИТ-аудитории это открытие говорит о необходимости более тщательной проверки своих систем на уязвимости. Помните, что базовые ошибки могут привести к утечкам данных или кражам информации. С учетом, что среди протестированных ИИ только Claude Mythos справился с задачей, многие компании могут задуматься о необходимости уделить внимание безопасности программных решений.
Выход Claude Mythos в открытый доступ может стать крупным шагом к революции в области безопасности, однако Anthropic тщательно заботится о том, чтобы модель не оказалась в руках злоумышленников, что создает дополнительные риски для сообщества разработчиков.