бенчмарки
Geekbench 7 стал ближе к реальным задачам и добавил CUDA
Geekbench 7 обновил CPU- и GPU-тесты: больше реальных нагрузок, AI-бенчмарки, переработанный multi-core и поддержка CUDA для Nvidia.
Новый бенчмарк AI-агентов проверяет не чат, а реальную работу
2,6% — средний полный pass rate в Agents’ Last Exam, бенчмарке AI-агентов на 1000+ рабочих задач. Почему рынок уходит от…
Moonshot выпустила Kimi K2.7-Code, но к бенчмаркам уже есть вопросы
Kimi K2.7-Code обещает на 30% меньше thinking-токенов, но независимые тесты пока не подтверждают заявленный рост качества.
AI IQ свёл языковые модели к шкале IQ и уже расколол рынок
Более 50 моделей ИИ свели к шкале IQ на aiiq.org: OpenAI, Anthropic и Google идут почти вровень, а спор о…

Данные по AI-бенчмаркам неверны — нужны новые подходы
Старые методы оценки AI устарели. Время переходить к более эффективным бенчмаркам для реального применения.
Cursor’s Composer 2 обошёл Opus 4.6 в бенчмарках программирования
AI-редактор Cursor's Composer 2 показал лучшие результаты по сравнению с Opus 4.6 при более низкой цене.
Google Gemini 3.1 Pro возглавил бенчмарки, но появился конкурент в 30 раз быстрее
Google Gemini 3.1 Pro снова лучший в тестах, но стартап Taalas создал чип с Llama 3.1 со скоростью 17k токенов/сек…
Ошибки в бенчмарках pgvector: как не вестись на ложные данные
Бенчмарки pgvector могут вводить в заблуждение. Узнайте, как правильно интерпретировать результаты для улучшения своих проектов.

Cognition выпустила бенчмарк FrontierCode для ИИ — 150 задач оценки кода
Cognition представила FrontierCode, новый бенчмарк для оценки ИИ по качеству кода, с 150 задачами и оценкой качества исполнения.