18 августа Anthropic запустила Anthropic Playground вместо Workbench, а уже через неделю новый инструмент сравнили с давним Playground от OpenAI. И сравнение для OpenAI вышло неприятным: по данным The New Stack, свежий интерфейс Anthropic оказался практичнее там, где разработчику нужен не красивый демо-режим, а быстрый переход от эксперимента к рабочему коду.
Сама замена получилась не косметической. Anthropic убрала Workbench из своей Console и поставила на его место Playground, который напрямую завязан на Messages API. Идея простая: то, что разработчик собирает в интерфейсе, должно максимально совпадать с тем, что потом уйдет в приложение. Цена этой прямоты тоже понятна: новый инструмент стал «без памяти». Он не хранит историю промптов на стороне Anthropic, не поддерживает сохраненные версии, evals и командный шаринг, которые были в Workbench. Данные из старого Workbench компания разрешила экспортировать только до 1 сентября.
На бумаге это выглядит как шаг назад по части удобств. Но тест The New Stack показывает, почему Anthropic могла сознательно урезать все лишнее. Автор сравнения дал обоим инструментам одинаковую задачу: собрать бота для ревью pull request. В случае с Anthropic Playground экспорт дал чистый Python-код, который можно было запускать сразу. У OpenAI сценарий оказался заметно менее аккуратным: вместо готового каркаса для работы система выгрузила фактически содержимое сессии целиком, включая предыдущие сообщения и зашифрованный блок рассуждений модели. Чтобы довести это до рабочего состояния, понадобилась ручная правка.
Это не та разница, которую можно списать на вкусовщину интерфейса. Для разработчика экспорт из playground-инструмента нужен ровно затем, чтобы сократить путь до первого рабочего прототипа. Если код после выгрузки приходится чистить от служебного мусора, копаться в структуре ответа и заново собирать логику вызова, то «песочница» превращается в еще один источник трения. Anthropic Playground, судя по тесту, в этом месте ведет себя как инженерный инструмент. OpenAI пока больше напоминает продукт, который долго обрастал слоями и теперь не всегда понимает, хочет ли он быть лабораторией для промптов, витриной возможностей или полу-IDE.
Второй показательный эпизод связан не с экспортом, а с отладкой. При упоре в лимит токенов Anthropic Playground выдал понятное и прикладное сообщение об ошибке. То есть не абстрактное «что-то пошло не так», а сигнал, после которого можно действовать. В интерфейсе OpenAI автор сравнения не смог быстро найти даже эквивалентную настройку, связанную с этим ограничением. Для новичка это раздражитель. Для опытной команды еще хуже: время уходит не на качество промпта или поведение модели, а на раскопки внутри интерфейса.
Контекст здесь важнее самой дуэли двух playground-ов. Anthropic не просто переименовала Workbench, а фактически признала, что хранить промпты, версии и оценочные сценарии внутри вендорской консоли уже не лучшая идея. Почти синхронно OpenAI объявила, что сохраненные Prompts и платформа Evals будут отключены 30 ноября. Сигнал для рынка считывается без особых подсказок: поставщики моделей все меньше хотят быть постоянным домом для вашей prompt-логики и все больше подталкивают команды к тому, чтобы держать ее в собственном коде, репозиториях и внутренних процессах. Иными словами, эпоха «настроим все в веб-интерфейсе, а потом как-нибудь разберемся» постепенно закрывается.
Для русскоязычной IT-аудитории здесь нет повода спорить о вкусе кнопок. Есть вполне прикладной вывод. Если ваша команда строит продукт вокруг LLM, playground нужен как временный стенд, а не как долговременное хранилище знаний о промптах. История версий, тестовые наборы, критерии качества и сценарии деградации должны жить там, где у вас уже живет остальной production-контур: в Git, CI, внутренних eval-пайплайнах и документации команды. Anthropic Playground в этой логике выглядит честнее: он не обещает лишнего и лучше выполняет базовую функцию. OpenAI, наоборот, пока расплачивается за наследие более старого инструмента, который пытается совместить слишком много ролей.
Это не означает, что у Anthropic уже получился идеальный стандарт. Отказ от сохранения истории и от встроенных evals для части команд станет минусом, особенно если у них нет собственной дисциплины вокруг prompt engineering. Но именно в этом и состоит неприятная правда нынешнего рынка: вендоры все охотнее дают мощные модели и все менее охотно берут на себя вашу внутреннюю инженерную гигиену. Поэтому главный вопрос теперь не в том, чей playground симпатичнее, а в том, готовы ли команды окончательно вынести работу с промптами из «песочницы» в нормальный контур разработки.