AI И НЕЙРОСЕТИ

Anthropic меняет PRD на evals и ищет продукты за 24 часа

Anthropic за 24 часа вывела на claude.ai эксперимент для 2000 пользователей и показала, почему оценки моделей уже вытесняют классические PRD.

✍️ Редакция iTech News | 28.07.2026 | ⏱ 4 мин | Источник: The New Stack
💡

Anthropic все чаще строит продукты не вокруг PRD, а вокруг evals — наборов проверок, которые показывают, что модель реально умеет, а где начинает фантазировать. Для русскоязычной IT-аудитории это важный сдвиг: оценки моделей из исследовательской экзотики быстро становятся рабочим инструментом для продуктовых и инженерных команд, особенно там, где поведение системы нельзя зафиксировать обычной спецификацией.

Об этом, как пишет The New Stack, рассказала Dianne Penn, глава продукта для AI Research and Labs в Anthropic, в разговоре на Lenny’s Podcast. Логика у компании довольно жесткая: если в обычной разработке команда пишет документ с требованиями, то в frontier AI она сначала собирает eval suite — то есть набор тестов и критериев, по которым можно судить, двигается модель в нужную сторону или нет. Причина проста: детерминированный софт можно описать через сценарии и acceptance criteria, а вероятностную модель — только через постоянную проверку на реальных и пограничных кейсах. Иначе вместо управления качеством получается очень дорогая игра в угадайку.

Penn прямо говорит, что переход от классического кода к вероятностным моделям ломает старые продуктовые привычки. Если раньше команда спорила о формулировках в PRD, то теперь ей важнее быстро находить баги, слабые места и неожиданные эффекты поведения модели. И здесь оценки моделей работают как живой артефакт, а не как документ для папки. Их можно обновлять, прогонять заново, использовать как барьер перед релизом и как источник обратной связи для следующей итерации. Для CTO, head of product и тимлидов это неприятная, но полезная новость: роль текста уменьшается, роль измеримой проверки растет.

Вторая важная деталь — устройство самой Anthropic. В середине 2024 года компания собрала Labs-команду для экспериментальных идей, которые не укладываются в обычный продуктовый роадмап. Задача этих маленьких групп — брать базовую гипотезу и смотреть, как выглядит ее версия не на 10%, а в 10, 100 или даже 1000 раз сильнее. В этой схеме нет любви к большим комитетам и бесконечным синкам: по словам Penn, крупные команды, которые берутся за размытые и слишком большие идеи, просто начинают тормозить сами себя. Для стартапов это звучит почти как алиби, для корпораций — как диагноз.

Самый показательный эпизод связан не с большим релизом, а с довольно странным экспериментом. Исследователи Anthropic усилили одну из интерпретируемых активационных характеристик модели и обнаружили, что Claude начинает буквально зацикливаться на мосте Golden Gate Bridge. Из этого за 24 часа собрали публичный consumer experience на claude.ai. Аудитория была скромной — около 2000 человек, то есть не тот масштаб, ради которого рисуют triumphant-слайды для совета директоров. Но именно этот кейс Penn назвала одной из скрытых точек перелома в самоопределении компании. Иными словами, Anthropic увидела, что может быстро превращать исследовательский артефакт в пользовательский продукт, не дожидаясь, пока идея пройдет через все круги корпоративного согласования.

Здесь и лежит главный контекст. На рынке ИИ все чаще побеждают не те, кто лучше пишет красивые стратегии, а те, кто умеет быстрее замыкать цикл между исследованием, тестированием и выводом функции к пользователю. Для обычного SaaS PRD по-прежнему живее всех живых: нужно описать роли, флоу, ограничения, интеграции, SLA. Но когда основа продукта — модель с нелинейным поведением, бумажная спецификация быстро устаревает. Сегодня модель держит один тип задач, завтра после новой настройки начинает валиться на другом, а послезавтра внезапно демонстрирует новую способность, которую никто отдельно не планировал. Поэтому оценки моделей становятся не дополнением к продуктовой работе, а ее центром.

Для разработчиков это означает сдвиг в навыках. Недостаточно просто интегрировать API модели и аккуратно обернуть его в UI. Нужно уметь формулировать проверяемые сценарии, собирать датасеты ошибок, проектировать рубрики качества и ловить регрессии до того, как их заметят пользователи. Для бизнеса вывод не менее прямой: скорость запуска AI-функции без системы evals может выглядеть впечатляюще ровно до первого провала в проде. Потом выясняется, что команда не может объяснить, почему вчера функция работала лучше, чем сегодня. В таком режиме PRD не спасает, потому что он не отвечает на главный вопрос — как именно измеряется успех модели и где проходит граница приемлемого качества.

История Anthropic интересна не тем, что компания придумала очередной модный лозунг про смерть документов. Интереснее другое: один 24-часовой эксперимент с почти игрушечным охватом в 2000 человек оказался важнее многих больших презентаций, потому что показал новую производственную логику AI-компании. Если этот подход закрепится, продуктовые команды будут все реже спрашивать «где спецификация?» и все чаще — «какой у нас eval и что он показывает прямо сейчас?». Для индустрии это уже не философия, а новая операционная дисциплина.

Поделиться: Telegram X LinkedIn