Итальянские AI-модели от Google, OpenAI и Anthropic потеряли деньги на ставках в Премьер-лиге, что ставит под сомнение их способности к долгосрочному анализу реальных событий. Исследование, проведенное стартапом General Reasoning, продемонстрировало, что даже самые продвинутые системы не способны адекватно реагировать на динамичные и сложные условия футбольного мира.
Что показало исследование
В отчете KellyBench стартапа General Reasoning были протестированы восемь топовых AI-систем в симуляции сезона 2023-24 Премьер-лиги. AI-моделям предоставили обширные исторические эти и статистику о командах и предыдущих матчах, с целью максимизировать доходы и управлять рисками. Каждая система получила три попытки заработать, но результаты оказались удручающими.
Согласно данным, наилучший результат показал AI Claude Opus 4.6 от Anthropic с потерей в 11%, в то время как xAI Grok 4.20 стал банкротом на одной из попыток и не смог завершить остальные две. Gemini 3.1 от Google сумел продемонстрировать 34% прибыли в одной из попыток, но также обанкротился в другой. Все AI-системы начали с начального капитала в £100,000.
Таблица результатов
| Модель | Средняя ROI | Лучшая попытка | Худшая попытка | Средний итоговый капитал |
|---|---|---|---|---|
| Claude Opus 4.6 | -11.0% | -0.2% | -18.8% | £89,035 |
| GPT-5.4 | -13.6% | -4.1% | -31.6% | £86,365 |
| Gemini 3.1 Pro | -43.3% | +33.7% | -100.0% | £56,715 |
| Grok 4.20 | -100.0% | -100.0% | -100.0% | £0 |
| Acree Trinity | -100.0% | -100.0% | -100.0% | £0 |
Ценные выводы для разработчиков
Результаты позволяют сделать вывод о том, что AI пока не способен заменить человеческий анализ в сложных, меняющихся условиях. Это добавляет уверенности профессионалам, которые переживают за свои рабочие места из-за автоматизации. Основатель General Reasoning Росс Тейлор отмечает, что текущие методы тестирования AI не отражают реальности и часто ведутся в статичных условиях.
Для российских разработчиков эта информация подчеркивает важность комплексного подхода к интеграции AI в бизнес-процессы. При разработке AI-решений важно учитывать не только технологические новшества, но и характер задач, которые должны решаться в динамичной среде.
В следующем исследовании планируется расширить детали невозможно закрытых долгосрочных результатов использования AI для принятия решений.