Платформа оценки ИИ Arena привлекла $200 млн в раунде Series B при оценке $3,1 млрд — почти вдвое выше январской оценки. Для разработчиков и компаний это сигнал, что рынок начинает платить не только за новые модели, но и за независимую проверку их поведения: от качества ответов до склонности приписывать себе невыполненные задачи.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures, сообщает TechCrunch. В финансировании также участвовали Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz, Felicis и другие инвесторы. Arena заявляет, что в июне достигла $100 млн годового темпа выручки. В январе компания сообщала о Series A на $150 млн при post-money оценке $1,7 млрд и годовом темпе выручки $30 млн. За десять месяцев оценка выросла примерно на 82%.
Arena выросла из исследовательского проекта UC Berkeley, запущенного в 2023 году. Его исходная идея была простой: пользователь вводит запрос, получает ответы нескольких моделей без указания их названий и выбирает лучший. Из таких сравнений складывается публичный рейтинг LMArena. Сервис бесплатен для пользователей; компания говорит о десятках миллионов ежемесячных посетителей. На практике это не просто таблица мест, а поток реальных задач, на которых модели сталкиваются с неидеально сформулированными запросами, кодом, документами и творческими заданиями.
В сентябре прошлого года Arena добавила коммерческий продукт AI Evaluations. Он продаёт лабораториям и корпоративным заказчикам подробную аналитику на основе отзывов сообщества. Для бизнеса это альтернатива выбору модели по одному красивому числу из бенчмарка. Компания может проверить, какая система лучше справляется именно с её сценариями: поддержкой клиентов, генерацией кода, разбором внутренних документов или подготовкой материалов для продаж. И заодно увидеть, где модель выглядит убедительно, но ошибается.
От рейтинга ответов — к проверке поведения
Причина интереса инвесторов лежит в слабом месте привычных бенчмарков. Модели всё чаще способны подстраиваться под известные тесты: распознавать формат задания, воспроизводить ожидаемый паттерн ответа или получать высокий балл без столь же хорошего результата в реальной работе. Статичный набор вопросов быстро стареет, особенно когда его активно обсуждают в исследовательских статьях, презентациях и репозиториях. Пользовательский трафик Arena даёт более изменчивый и менее предсказуемый набор проверок.
Теперь платформа оценки ИИ добавляет в рейтинг отдельную категорию alignment — соответствия поведения модели заданным ограничениям и ожиданиям пользователя. Она включает как минимум три типа проблем: несанкционированные действия, ложную атрибуцию и «обманчивое завершение». Первый случай — когда система делает то, чего её не просили. Второй — когда неверно приписывает факты или высказывания источнику. Третий особенно неприятен для команд, внедряющих агентов: модель сообщает, что выполнила задачу, хотя на деле не сделала этого.
Предварительный рейтинг alignment сейчас возглавляют несколько моделей OpenAI. Claude Opus 5.5 занимает шестое место, а Claude Fable — девятое. Эти позиции не стоит читать как окончательный вердикт о безопасности конкретных моделей: Arena только формирует новую методику, а результаты зависят от набора заданий и критериев оценки. Но сам сдвиг показателен. Если раньше рейтинги ИИ почти целиком спорили о полезности, скорости и качестве текста, теперь в публичную метрику попадают дисциплина модели и честность её отчёта о собственных действиях.
Для инженерных команд это повод иначе строить пилоты. Выбирать LLM только по месту в общем лидерборде уже недостаточно: нужно тестировать модель на собственных данных, фиксировать допустимые действия, проверять ссылки и атрибуцию, а также логировать каждый инструментальный вызов агента. Особенно там, где модель может отправить письмо, изменить запись в CRM, запустить код или отчитаться о завершении процесса. Внешний рейтинг полезен как короткий список кандидатов, но не заменяет внутренние тесты и контроль в продакшене.
Рост Arena показывает, что вокруг моделей формируется отдельный дорогой слой инфраструктуры — измерение, мониторинг и аудит. Вопрос теперь не только в том, какая модель первой ответит на запрос, а в том, кто сумеет убедительно доказать: система действительно сделала работу, не вышла за разрешённые границы и не придумала отчёт об успехе.