AI И НЕЙРОСЕТИ

AI-модели терпят неудачи в каждом третьем запуске — вновь растёт вопрос аудита

AI-модели показывают 30% провалов при производственных попытках, это ломает стабильность работы предприятий. Подробности в статье.

✍️ Редакция iTech News | 15.04.2026 | ⏱ 2 мин | 👁 8 | Источник: VentureBeat
🎯

AI-модели сталкиваются с серьезными проблемами, показывая провалы в каждом третьем запуске. Эта информация, представленная в девятом ежегодном отчете AI Index от Stanford HAI, подчеркивает основной вызов для IT-лидеров в 2026 году — несоответствие между возможностями и стабильностью работы.

Проблема использования AI в бизнесе

AI теперь плотно интегрированы в корпоративные рабочие процессы; однако в 2025 году успешность моделей оставалась на уровне лишь 70%. Это создает большую проблему для бизнеса, который рассчитывает на надежность технологий. Например, модели могут решать сложные задачи на уровне Международной математической олимпиады, но не всегда могут справиться с более простыми задачами, такими как определение времени.

По состоянию на начало 2026 года принятие ЭА (Enterprise AI) достигло 88%. Значительное улучшение в точности моделей за прошедший год было зафиксировано на тестах Humanity's Last Exam, где они улучшили свои результаты на 30% — лучший показатель в детали 2500 вопросов по разным научным темам.

Технические достижения и проблемы

На тесте MMLU-Pro, который включает многосложное мышление, модели показали показатели выше 87%. Однако это подчеркивает, насколько сложной становится граница возможностей AI, как это называет Этан Моллик из Stanford HAI. По результатам другого теста τ-bench лидирующие модели, такие как Claude Opus 4.5 и GPT-5.2, набрали от 62,9% до 70,2%. Сравнительно, производительность моделей по GAIA поднялась с 20% до 74,5%. Уровень успешности решений для реальных программных задач достиг почти 100% в тестах SWE-bench Verified.

Серьезные достижения наблюдаются и в области кибербезопасности: с 15% успеха в 2024 году до 93% в 2026 году для обработки профессиональных задач — серьёзный прогресс за относительно короткое время. Модели теперь способны решать задачи с высоким уровнем сложности и могут эффективно работать в реальных условиях.

Что это значит для бизнеса

Для российских предприятий это означает, что необходимо учитывать возможные риски, связанные с внедрением AI. Необходимо внедрять системы контроля и тестирования на надежность, чтобы минимизировать шансы на сбои. Важно помнить, что, несмотря на впечатляющий рост в некоторых областях, в других AI-модели по-прежнему несут высокий риск неудач.

В ближайшие годы важно будет следить за тем, как компании будут адаптировать свои подходы к использованию AI с учетом его недостатков, а также развивать технологии для повышения их надежности.

Поделиться: Telegram X LinkedIn