Примерно за $33 и около 8 млн токенов AI coding agents собрали в браузере 3D-копию Union Square в Сан-Франциско. Эксперимент PhiloLabs важен не потому, что агенты снова что-то «написали», а потому, что проект проверял более неприятную для автоматизации вещь: можно ли сгенерировать не просто рабочий код, а среду, которая хотя бы визуально похожа на реальный город.
Как пишет The New Stack, в центре эксперимента была реконструкция площади Union Square на чистом Three.js. За два часа агенты собрали сцену с 453 контурами зданий, 75 кастомными фасадами, 129 именованными витринами, 220 пешеходами и 109 машинами, включая канатные трамваи на Powell Street. На бумаге это уже звучит как типичная история про «смотрите, ИИ заменил команду». Но здесь интереснее другое: рабочее приложение оказалось лишь половиной задачи.
PhiloLabs сознательно выбрала проект, где нельзя отделаться зелёным прогоном тестов. Если сервис отвечает 200 OK, это ещё не значит, что улица похожа на улицу, а магазин стоит там, где должен. Поэтому в цикл разработки добавили Playwright: инструмент проходил по 34 заранее заданным точкам камеры и снимал скриншоты сцены, которые потом сравнивали с фотографиями реального Union Square. В итоге агенты подготовили 147 листов сравнения. Такой подход позволял ловить ошибки, которые не проявляются в коде напрямую: неправильные пропорции здания, витрина не на той стороне улицы, спорная геометрия перекрёстка, странная посадка объекта в городской среде. Формально всё может рендериться без ошибок, но выглядеть при этом так, будто город рисовали по памяти после ночного деплоя.
Дальше началась ещё более показательная часть. PhiloLabs не ограничилась одним «роем» исполнителей и подключила агентов-рецензентов с разными ролями. Одни фокусировались на архитектуре и географии, другие на техническом арте и взаимодействиях. По итогам они выпустили девять отчётов, которые превратились в список исправлений для следующего прохода. По сути, это попытка собрать из агентов не просто генератор кода, а мини-конвейер с разделением труда: одни строят, другие проверяют, третьи возвращают задачи в доработку. Для индустрии это, возможно, важнее самой 3D-сцены. Рынок постепенно уходит от вопроса «умеет ли модель писать код» к более жёсткому вопросу: «какой контур верификации не даст ей незаметно сделать ерунду».
На этом месте полезно сбавить градус восторга. Данные для такой реконструкции не взялись из ниоткуда. Агенты опирались на открытые геоданные, в первую очередь OpenStreetMap и данные USGS о рельефе, а затем дополняли их сведениями о реальной локации и референсными фотографиями. Проблема в том, что геоданные хорошо отвечают на вопрос «где стоит здание», но плохо отвечают на вопрос «как именно выглядит его фасад». Фото, наоборот, показывают лишь отдельные углы и ракурсы. Всё, что не попало в источник, агентам приходилось достраивать по косвенным признакам. А это уже зона, где второй агент-проверяющий не гарантирует правду: он может повторить ту же неверную догадку, просто более уверенным тоном.
Отсюда и главный практический вывод для разработчиков и продуктовых команд. AI coding agents уже неплохо справляются там, где задачу можно разложить на параллельные подзадачи, дать им понятные артефакты и встроить повторяемую проверку. В данном случае сработала связка из субагентов, параллельного выполнения и повторного использования контекста, что и удержало стоимость запуска на уровне примерно $33. Но сама цифра тут легко сбивает с толку. Она не означает, что любой сложный интерфейс, симулятор или фронтенд можно теперь собрать «за цену бизнес-ланча». Она означает только то, что при узком, хорошо очерченном сценарии агенты уже умеют выдавать впечатляющий первый драфт достаточно дёшево.
И именно слово «драфт» здесь ключевое. The New Stack отдельно замечает, что скриншотная проверка начинает терять эффективность в более сложных приложениях. Если часть проблем спрятана в логике, состояниях, редких пользовательских сценариях или накопительных эффектах взаимодействия, картинка уже не спасает. Можно увидеть красивую сцену и пропустить то, что реальный пользователь сломает за пять минут. Для cloud-native и enterprise-разработки это особенно знакомая ловушка: демо работает, а эксплуатация быстро объясняет разницу между «запустилось» и «готово к продакшену».
Для русскоязычной IT-аудитории этот кейс полезен не как очередной повод спорить, «заменит ли ИИ разработчиков», а как сигнал о сдвиге в инженерной дисциплине. AI coding agents становятся не только авторами кода, но и участниками QA-контура, где проверка всё чаще опирается на визуальные, поведенческие и доменные критерии, а не только на юнит-тесты и линтеры. Вопрос теперь не в том, смогут ли агенты собрать что-то эффектное за пару часов, а в том, кто первым научится дешёво и надёжно отличать убедительную имитацию качества от настоящего качества продукта. Подробности эксперимента собраны в материале .