Snorkel AI привлекла $350 млн и получила оценку $3,5 млрд — почти втрое выше, чем 17 месяцев назад. Для рынка это еще один сигнал: данные для обучения ИИ стали не скучной инфраструктурой на заднем плане, а отдельной гонкой капиталов, маржи и дефицитных специалистов.
Раунд Series E возглавили Insight Partners и S32, сообщает TechCrunch. В сделке также участвовали существующие инвесторы Snorkel AI: Addition, Lightspeed, Greylock, GV и Wells Fargo. Семилетний стартап на предыдущем раунде Series D привлек $100 млн при оценке $1,3 млрд, а теперь перескочил на уровень $3,5 млрд — без привычной для софтверных компаний истории про красивую кнопку в интерфейсе. Здесь продают сырье для моделей: датасеты, среды для обучения и симуляции.
Snorkel AI начинала с другого угла. Компания предлагала софт для автоматизации разметки данных: вместо того чтобы руками проставлять миллионы меток, команды могли задавать правила, подключать модели и ускорять подготовку обучающих выборок. Но в прошлом году стартап сместил фокус к data-as-a-service: клиентам теперь продают не только инструмент, а готовые наборы данных и RL-среды. Проще говоря, меньше конструктора, больше готового топлива для лабораторий ИИ и корпоративных команд.
Модель Snorkel интересна тем, что она не сводится к бирже человеческих экспертов. Компания использует гибридный подход: собственное ПО и модели помогают генерировать синтетические данные, а предметные специалисты добавляют экспертизу там, где простой краудсорсинг ломается. Это важно для задач, где нужна не массовая разметка котиков и дорожных знаков, а качественные примеры для сложных доменов: корпоративные процессы, код, юридические или финансовые сценарии, специализированные симуляции.
По данным компании, текущий годовой run-rate выручки достиг $375 млн. Snorkel утверждает, что за 12 месяцев этот показатель вырос в 18 раз. Это не финальная годовая выручка по аудированной отчетности, а темп, пересчитанный в годовом выражении, поэтому его не стоит читать как бухгалтерский факт за завершенный период. Но даже с этой оговоркой цифра объясняет, почему инвесторы снова достают крупные чеки: лаборатории ИИ уперлись не только в GPU, но и в качественные данные для обучения ИИ.
Snorkel не одинока. TechCrunch приводит рядом другие компании, которые называют себя AI data labs и быстро растут на спросе со стороны разработчиков моделей. У Mercor валовая годовая выручка в пересчете достигла $2 млрд, Handshake ранее в этом году дошла до отметки $1 млрд, Micro1, по данным TechCrunch, масштабировалась до $500 млн. Но тут есть важная бухгалтерская заноза: такие компании часто перечисляют 60-70% верхней строки профильным специалистам, которые выполняют работу. Поэтому их чистая выручка заметно ниже громких gross-показателей.
У Snorkel механика выглядит иначе. Компания продает не столько человеко-часы экспертов, сколько готовые датасеты и среды для reinforcement learning. Выплаты специалистам, по словам компании, проходят через себестоимость, а не раздувают headline-выручку в стиле маркетплейсов. Для инвесторов это может быть принципиальной разницей: одно дело — платформа с огромным оборотом и тонкой маржой, другое — поставщик продукта, где человеческая экспертиза встроена в производство, но не является всей бизнес-моделью.
Для разработчиков и технических руководителей эта история полезна не только как венчурная хроника. Она показывает, куда смещается узкое место в ИИ-проектах. Еще недавно многие компании думали, что главный вопрос — какую модель взять и где арендовать вычисления. Теперь все чаще выясняется: модель без правильных обучающих примеров, проверочных сценариев и доменных симуляций быстро превращается в дорогую демоверсию. Особенно если речь идет не о чат-боте для сайта, а о системе, которая должна стабильно работать в продукте, банке, промышленности или службе поддержки с реальными SLA.
Для бизнеса это означает неприятную, но полезную правду: данные для обучения ИИ нельзя купить один раз как офисные кресла. Их нужно проектировать, обновлять, проверять и привязывать к конкретным задачам. Хороший датасет становится частью продукта, а не приложением к нему. Поэтому вокруг него появляется отдельная цепочка поставщиков: кто-то собирает экспертов, кто-то строит симуляторы, кто-то автоматизирует разметку, кто-то упаковывает все это в сервис с понятной ценой и сроками.
История Snorkel AI еще не отвечает на главный вопрос: сколько в этом рынке устойчивой экономики, а сколько горячего воздуха от гонки больших моделей. Но направление видно уже сейчас. Если в первой фазе ИИ-бума все считали GPU и параметры моделей, то следующая фаза будет гораздо менее глянцевой: качество датасетов, стоимость экспертной разметки, синтетические данные, RL-среды и способность доказать, что модель стала лучше не на слайде, а в рабочем контуре.