AI И НЕЙРОСЕТИ

Jev прошел Pokémon Red за неделю: не LLM, а модель решений

23 сентября 2026 года Jev прошел Pokémon Red за неделю с помощью Claude Opus 5. Что это говорит о связке LLM и моделей решений.

✍️ Редакция iTech News | 28.09.2026 | ⏱ 4 мин | Источник: Tom's Hardware
🎓

Jev Pokémon Red прошел за неполную неделю: модель решений TypeSafe AI победила Элитную четверку и Чемпиона 23 сентября 2026 года. По данным Tom's Hardware, важна не сама победа в старой игре Nintendo, а схема: играл не чат-бот, а специализированная модель, которой Claude Opus 5 фактически правил дорожную карту.

Разработчик проекта Эндрю Бойд, основатель Standard Agents Inc., запустил трансляцию 17 сентября. За игрой можно было следить в браузере или терминале через команду npx jev-plays-pokemon, а чат требовал GitHub OAuth. В этой конструкции Jev был и игроком, и модератором чата. Звучит как типичный эксперимент из категории «зачем?», но для разработчиков агентов тут есть полезный слой: модель не пыталась быть универсальным собеседником, она выбирала действие из ограниченного списка.

Jev не является LLM и не генерирует текст, картинки или «рассуждения» в привычном чат-интерфейсе. Модель получает набор вариантов, фактов и контекста, затем выбирает наиболее вероятное решение и возвращает оценку уверенности. Она не читала экран Pokémon Red напрямую. Вся магия была в обвязке: игровой лог превращался в структурированные варианты, а Claude Opus 5 следил за тем, где система застревает, и менял формулировки, подсказки и доступные опции.

Именно поэтому результат нельзя честно подать как «ИИ сам прошел игру». В журнале изменений harness, то есть управляющей прослойки, набралось 474 записи. Большая часть описывала провал и последующую правку. Среди характерных ошибок: Jev десятки раз упирался в закрытый вход к Лорелей, более сотни раз за десять минут ходил по одной и той же лестнице в Rock Tunnel, а после победы над всей Элитной четверкой проиграл Алаказаму Чемпиона. Из-за этого пришлось заново проходить всех четырех тренеров, прежде чем модель добралась до финальной победы.

Claude Opus 5 работал не как игрок с геймпадом, а как инженер, который чинит интерфейс между задачей и моделью. Он сокращал объем текста, отправляемого Jev, примерно на две трети, заменял числа словами и помогал снижать стоимость вызовов. Когда Jev попадал в петли, частоту запросов к модели уменьшили: решение стали запрашивать раз в шесть секунд, а не примерно раз в секунду. Это уже больше похоже не на «интеллект в коробке», а на оптимизацию пайплайна, где качество зависит от схемы данных, частоты вызовов и аккуратной постановки вариантов.

В проекте участвовали и люди. Зрители писали советы в чат, полезные замечания попадали в список опций для Jev. Для бизнеса и команд, строящих AI-агентов, это хороший холодный душ: автономность часто оказывается не бинарным свойством, а уровнем поддержки. Один агент выбирает, другой агент переписывает среду, люди подкидывают исправления, а результат потом выглядит как победа одной модели. Маркетингово это менее красиво, зато инженерно гораздо правдивее.

Интересно, что похожий запуск сделал Кристиан Матисен из Frigade. В его версии harness читал память игры, составлял список легальных действий, а Jev выбирал одно из них. В память игры система не писала. Матисен признал, что первая версия, где Jev мог напрямую нажимать кнопки, даже не вышла из Pallet Town. Оценка расходов у него получилась скромной: примерно от $1 до $1,70 за сутки работы. Для эксперимента с агентами это почти карманный бюджет, если не считать времени разработчика, которое обычно и есть настоящая статья расходов.

На другом полюсе находится эксперимент разработчика stmonty: он обучал небольшую world model на RTX 3080 Ti, используя более 42 000 кадров игрового процесса. Модель стартовала из сохранения в лаборатории профессора Оука и выбирала стартового покемона в 52 попытках из 100. Задача была куда уже, зато условия жестче: системе приходилось понимать последствия действий по скриншотам, без заранее подготовленного списка легальных вариантов. На фоне этого Jev Pokémon Red показывает не «универсальный разум», а силу хорошо размеченной среды.

Реакция разработчиков была заметной: LangChain описал запуск Jev как проект с неожиданно большим откликом после релиза 15 сентября. За десять дней несколько команд уже пробовали свои версии прохождения Pokémon Red. Причина понятна. После месяцев стримов, где классические чат-боты бродят по игре и регулярно теряют цель, связка модели решений и LLM-коуча выглядит практичнее. LLM хорош там, где нужно переформулировать, обобщать и чинить правила. Модель решений хороша там, где нужно выбрать из ограниченного набора действий.

Для русскоязычных IT-команд урок довольно приземленный: агентные системы выигрывают не только от «более умной модели», но и от правильного интерфейса между моделью и миром. Если задача сводится к выбору из допустимых действий, не всегда нужен огромный чат-бот, который пытается одновременно видеть, планировать, объяснять и нажимать кнопки. Иногда выгоднее дать маленькой специализированной модели аккуратный список вариантов, а LLM поставить рядом как редактора правил.

Победа Jev Pokémon Red не закрывает спор об автономных агентах, скорее делает его взрослее. Следующий вопрос для отрасли: сколько реальных рабочих процессов можно превратить из хаотичного «сделай что-нибудь» в набор проверяемых решений, где LLM не герой сцены, а инженер за кулисами.

Поделиться: Telegram X LinkedIn