На сайте aiiq.org больше 50 языковых моделей разложили по человеческой шкале IQ, а на вершине, по этой методике, оказались системы OpenAI, Anthropic и Google с разницей буквально в несколько пунктов. Для рынка это не просто очередная красивая диаграмма: рейтинг AI IQ пытается решить практическую задачу, которая уже достала и разработчиков, и CIO, и продактов, — как сравнивать модели разных вендоров без десяти вкладок с несовместимыми бенчмарками.
Проект, как пишет VentureBeat, запустил инженер и инвестор Райан Ши, сооснователь блокчейн-платформы Stacks. Его идея проста и поэтому раздражает половину индустрии: взять 12 известных тестов, собрать их в четыре группы — абстрактное, математическое, программное и академическое мышление — а затем вывести сводную оценку, похожую на IQ человека. Для абстрактного блока используются ARC-AGI-1 и ARC-AGI-2, для математики — FrontierMath, AIME и ProofBench, для программирования — Terminal-Bench 2.0, SWE-Bench Verified и SciCode, для академического блока — Humanity’s Last Exam, CritPt и GPQA Diamond.
Самая спорная часть здесь не список тестов, а способ пересчёта сырых результатов в «подразумеваемый IQ». На aiiq.org это делается через вручную откалиброванные кривые сложности. Более простым или потенциально «загрязнённым» обучающими данными бенчмаркам заранее режут потолок, чтобы они не раздували итоговые баллы выше 100. С более сложными тестами сайт обходится щедрее. Если по модели не хватает данных, система, наоборот, тянет итог вниз, а не вверх. Формально это выглядит как попытка не дать вендорам выиграть на пробелах в измерениях. Практически — как напоминание, что любой красивый сводный индекс держится на довольно субъективной кухне.
По состоянию на середину мая 2026 года картина у сервиса такая: GPT-5.5 от OpenAI набирает около 136 пунктов и идёт первым, Opus 4.7 от Anthropic держится примерно на 132, Gemini 3.1 Pro от Google — около 131, GPT-5.4 — тоже в районе 131, Opus 4.6 — около 129. Главный вывод не в том, кто на полкорпуса впереди, а в том, насколько тесно стало на верхушке. Если ещё недавно рынок жил логикой «есть лидер и остальные», то теперь фронтир выглядит как плотная группа моделей, где отрыв уже не драматический. Для бизнеса это неприятная новость для продавцов премиум-API и хорошая для покупателей: переплата за лучший результат стала заметно менее очевидной.
Ещё интереснее середина таблицы. По данным проекта, модели китайских лабораторий — Kimi K2.6, GLM-5, DeepSeek-V3.2, Qwen3.6, MiniMax-M2.7 — скучиваются примерно в диапазоне 112–118 пунктов. Это уже не «дешёвые альтернативы для галочки», а плотный рабочий слой для тех, кому не нужен абсолютный максимум на каждом запросе. И вот тут рейтинг AI IQ внезапно становится полезным не как шоу, а как закупочный инструмент. Когда модель за несколько долларов на типовой задаче даёт результат, близкий к варианту за несколько десятков, разговор быстро смещается от бренда к маршрутизации нагрузки: какую задачу отправлять в дорогой стек, а какую — в дешёвый.
Отдельный источник споров — попытка померить не только IQ, но и EQ моделей. Сайт строит эмоциональную оценку на основе EQ-Bench 3 Elo и Arena Elo, а затем сводит их в общий показатель. В этой системе Opus 4.7 выходит в лидеры по «эмоциональному интеллекту» с оценкой около 132 и попадает в наиболее привлекательный квадрант — высокий IQ плюс высокий EQ. У OpenAI, по версии сервиса, чуть сильнее когнитивная часть, но слабее эмоциональная. У Google — более ровная середина. Проблема в том, что EQ-Bench 3 оценивается Claude, то есть моделью Anthropic, и автор проекта вынужден отдельно признавать возможный перекос в пользу Anthropic. Чтобы его сгладить, сервис штрафует все модели Anthropic на 200 Elo именно в EQ-компоненте. Такой самоаудит для мира AI-бенчмарков редкость, но от вопросов не спасает: если метрику приходится чинить вручную ещё до публикации, доверие к ней автоматически становится осторожным.
Почему вокруг шкалы IQ столько шума
Критика у проекта предсказуемая, но не пустая. Главный аргумент противников такой: языковые модели слишком «рваные», чтобы честно ужимать их в одно число. Они могут уверенно решать сложные задачи по физике, а затем проваливаться на тестах, которые человек воспринимает как почти детские. Один агрегированный балл в таком случае создаёт иллюзию точности там, где на самом деле живёт мешанина сильных и слабых сторон. С этим трудно спорить: карта действительно не равна территории, особенно если территория каждую неделю меняет рельеф.
Есть и более предметные претензии. Исследователи и комментаторы указывают на неполную прозрачность методики: сайт показывает сами бенчмарки и форму калибровочных кривых, но не публикует полный открытый набор данных и точные математические преобразования в виде, удобном для независимой перепроверки. Для академической среды это серьёзный минус. С другой стороны, у корпоративного рынка свой критерий полезности. Если на одной странице можно быстро увидеть соотношение «качество, цена, поведенческая адекватность», многие готовы мириться с методологической шероховатостью ради скорости решений.
Именно поэтому самая практичная визуализация на сайте — не колокол IQ, а график IQ против эффективной стоимости. В нём GPT-5.5 и Opus 4.7 сидят в зоне высокой цены и высокой способности: больше 30 и 50 долларов за условную задачу соответственно. Ниже и правее обнаруживается тот самый сладкий диапазон для продакшена: GPT-5.4-mini, DeepSeek-V3.2 и MiniMax-M2.7 с оценками примерно 112–120 и эффективной стоимостью около 1–5 долларов. На совсем дешёвом краю фигурирует GPT-oss-20b с ценой около 0,20 доллара и IQ порядка 107. Для задач вроде классификации, извлечения данных и первичной сортировки заявок этого уже может быть более чем достаточно. И вот здесь спор о философии интеллекта отходит на второй план: у компаний банально есть бюджеты, SLA и счета за токены.
Главный эффект от всей истории не в том, что индустрия вдруг договорилась, как мерить интеллект машин. Она как раз не договорилась. Эффект в другом: рынок быстро приходит к модели, где выигрывает не один «самый умный» API, а грамотно собранный стек из нескольких моделей разной цены и специализации. Если рейтинг AI IQ и полезен, то прежде всего как грубая карта для такой оркестрации, а не как священная таблица истинных способностей. Следующий раунд спора будет уже не о красивых цифрах на колоколе, а о том, чьи метрики лучше помогают выбрать рабочую архитектуру, а не просто победителя недели. Подробности исходной публикации — в .