Google обновила Android Bench и впервые вывела в лидеры OpenAI GPT-5.5: модель набрала 74 балла в тестах для Android-разработки. Для русскоязычных команд здесь важна не только смена лидера, но и новая прозрачность бенчмарка: теперь Google показывает не просто итоговый рейтинг, а еще задержку, расход токенов и ориентировочную стоимость прогона.
Новый срез рейтинга опубликован по состоянию на 18 мая 2026 года, а о деталях обновления сообщает 9to5Google. По версии Google, GPT-5.5 обошла GPT-5.4 и Gemini 3.1 Pro Preview примерно на 1,6 пункта: у нее 74 балла против 72,4 у обеих моделей. Для бенчмарка, который измеряет прикладные задачи Android-разработки, это не разгром, а скорее победа по очкам. Но в таких историях обычно важнее другое: насколько дорого стоит эта «лучшая» модель и что именно получает команда за доплату.
С этим у свежего Android Bench как раз стало интереснее. Google добавила три новых публичных метрики. Average Latency показывает, сколько времени уходит на решение 100 задач в 10 прогонах. Average Total Tokens отражает общий расход токенов за полный прогон бенчмарка. Average Cost считает среднюю стоимость такого прогона в долларах на момент тестирования. Именно эти цифры превращают рейтинг из привычной витрины «кто умнее» в инструмент для более взрослого разговора: не только о качестве кода, но и о цене за единицу пользы.
Если смотреть на первую десятку, картина получается довольно приземленная. GPT-5.5 с результатом 74 балла имеет среднюю задержку 15,5, потребляет 64,5 токена по внутренней метрике теста и стоит $133,9 за прогон. GPT-5.4 идет второй с 72,4 балла, задержкой 21,2 и стоимостью $91,7. Gemini 3.1 Pro Preview делит второе место по баллам, но выглядит куда практичнее по экономике: latency 11,5 и средняя цена $49. Дальше в списке расположились Claude Opus 4.7 с 68,7 балла и стоимостью $124,3, GPT 5.3 Codex с 67,7 балла и ценой $42,6, Claude Opus 4.6 с 66,6 балла и ценой $84,4, GPT 5.2 Codex с 62,5 балла и ценой $121,9, Claude Opus 4.5 с 61,9 балла, Gemini 3 Pro Preview с 60,4 и GLM 5.1 с 59,7 балла. Проще говоря, первое место у OpenAI, но ценник у Gemini все еще выглядит как аргумент для тех, кто считает деньги хотя бы раз в квартал.
Для разработчиков это важная развилка. Внутри команд, которые используют ИИ не для красивых демо, а для реальной генерации кода, исправления багов, написания UI и соблюдения Android best practices, выбор модели давно перестал быть вопросом «какая мощнее на бумаге». Если модель дает плюс полтора балла в бенчмарке, но обходится больше чем вдвое дороже ближайшего конкурента, это уже разговор не про лидерборд, а про бюджет на CI, внутренние инструменты, код-ассистентов и эксперименты продуктовых команд. Особенно если учесть, что у Gemini 3.1 Pro Preview при том же счете, что и у GPT-5.4, еще и ниже latency.
Есть и второй слой этой истории: Google явно пытается показать, что рынок больше не делится на «закрытые топовые модели» и все остальные. В обновленном Android Bench стало больше open-weight-моделей, включая Gemma, Qwen, DeepSeek, MiMo и другие. Лучший результат среди них показала GLM 5.1, следом идет Kimi K2.6. Да, эти модели пока не забирают первое место в общем зачете, но сам факт их присутствия в одной таблице с GPT, Gemini и Claude меняет тон обсуждения. Еще год назад открытые модели в подобных рейтингах часто проходили по категории «любопытно, но не для продакшна». Теперь они уже участвуют в сравнении на более серьезных основаниях: с цифрами по качеству, задержке и стоимости.
Контекст тоже показателен. Когда Google только запустила этот бенчмарк в начале года, лидером была Gemini 3.1 Pro. Позже GPT-5.4 сравнялась с ней по верхней строчке. Теперь вперед вышла GPT-5.5. Такие перестановки происходят почти ежемесячно, и это неплохая иллюстрация состояния рынка: никакой устойчивой монополии на «лучшую модель для кода» нет, а преимущество живет до следующего апдейта таблицы. Для бизнеса это означает неприятную, но полезную вещь: стратегию выбора ИИ-модели нельзя один раз утвердить на архитектурном комитете и забыть на год. Лидер меняется быстрее, чем обычно согласуются закупки.
Для Android-команд главный вывод звучит скучно, но полезно: смотреть нужно не на победителя, а на профиль задачи. Если нужен максимум качества любой ценой, GPT-5.5 сейчас выглядит сильнее остальных. Если важен баланс между результатом, скоростью и стоимостью, Gemini 3.1 Pro Preview выглядит очень конкурентно. Если команда строит собственные пайплайны и хочет больше контроля над развертыванием, придется внимательно следить за open-weight-сегментом, даже если он пока не на вершине таблицы. В кодогенерации рынок все еще ведет себя как ранний этап гонки процессоров: разница в процентах шумная, зато разница в цене и операционных ограничениях быстро становится решающей. Исходные цифры и расклад моделей можно сверить в материале ; дальше интрига простая: сможет ли Google вернуть первое место с выходом Gemini 3.5 Pro, или Android-разработка окончательно перестанет быть для нее домашним полем.