AI И НЕЙРОСЕТИ

GLM-5.3-Flash оказался дешевле флагмана, но не быстрее

GLM-5.3-Flash в тесте The New Stack набрал 27 из 27, как и GLM-5.3, но в среднем отвечал в 2,4 раза медленнее при заметно меньшей цене.

✍️ Редакция iTech News | 02.09.2026 | ⏱ 5 мин | Источник: The New Stack
🔬

У Z.AI вышла странная пара моделей: флагманская GLM-5.3 и более дешёвая модель GLM-5.3-Flash, которую компания подаёт как почти столь же умную, но куда более выгодную. Практический тест показал, что модель GLM-5.3-Flash действительно даёт тот же результат по качеству, но расплачивается за это временем: средний ответ занял 165,7 секунды против 69,5 секунды у GLM-5.3.

Это важно не только для любителей сравнительных таблиц. Для команд, которые строят AI-фичи в продукте, считают юнит-экономику агентных сценариев или просто не хотят, чтобы пользователи смотрели на спиннер по три минуты, разница между «дешевле на токен» и «быстрее в задаче» уже не академическая. Как пишет The New Stack, в ряде случаев бюджетная версия выигрывает по цене без потери точности, но на сложных запросах начинает буквально думать вслух за ваш счёт по времени.

Поводом для сравнения стал запуск GLM-5.3-Flash 26 августа 2026 года. Z.AI обещала «флагманский» уровень интеллекта при низкой цене, а также трёхкратный прирост скорости обслуживания по сравнению с GLM-5.3, выпущенной ранее в августе. По прайсу на OpenRouter разрыв выглядит очень агрессивно: у Flash входные токены стоят 0,075 доллара за миллион, выходные 0,25 доллара. У GLM-5.3 те же позиции стоят 1,188 и 4,18 доллара соответственно. На бумаге Flash почти в 16 раз дешевле, и для любого продакта это тот самый момент, когда хочется уже открывать калькулятор и писать в чат: «Берём».

Дальше начинается менее рекламная часть. В тесте использовали три практические задачи и 27 проверяемых критериев: генерацию Python-функции для парсинга дат с жёсткими краевыми случаями, логическую задачу с расписанием пяти человек и извлечение структурированных данных из цепочки писем о продлении контракта. Итог по точности оказался почти издевательски ровным: обе модели набрали 27 из 27. То есть в сухом остатке GLM-5.3 и модель GLM-5.3-Flash не разошлись по качеству ни на коде, ни на логике, ни на извлечении данных.

Главный разрыв открылся в том, сколько ресурсов потребовалось на одинаковый результат. Самой тяжёлой оказалась задача с Python-функцией для преобразования даты в формат YYYY-MM-DD. Обе модели выдали рабочий код, который прошёл все 12 скрытых тестов, включая ловушки вроде несуществующих дат и двухзначных годов. Но Flash шла к ответу 455,8 секунды и сожгла 38 677 токенов. GLM-5.3 справилась за 174,7 секунды и 14 801 токен. По деньгам Flash всё равно вышла дешевле: 0,019 доллара против 0,065. Зато по времени и объёму вычислений разница выглядит так, будто дешёвая модель просто дольше ищет тот же выход из комнаты.

На более лёгких задачах картина уже не такая линейная. В логической задаче с пятью консультантами и семью правилами обе модели нашли единственно верное расписание. GLM-5.3 ответила за 18,9 секунды и использовала 1 804 выходных токена, Flash за 33,5 секунды и 1 003 токена. Здесь бюджетная версия оказалась дешевле, но снова медленнее. А вот на извлечении данных из переписки о продлении подписки она наконец сыграла именно ту роль, которую от неё ждут: ответ за 7,7 секунды против 14,8 у флагмана. Обе модели корректно вытащили 10 полей, не попались на ловушку с 8-процентной скидкой и верно посчитали финальную цену 67 712 долларов для пересмотренного предложения на 92 места стоимостью 73 600 долларов.

Если свести всё в одну таблицу, получается неприятно честная история. По суммарному расходу токенов Flash почти в 2,3 раза прожорливее: 41 050 против 17 867. По суммарной стоимости, наоборот, заметно выгоднее: 0,0198 доллара против 0,0757. Но среднее время ответа у неё хуже более чем вдвое. Для разработчиков это важная развилка. Если ваш сценарий состоит из коротких запросов на извлечение данных, простой автоматизации и недорогих batch-задач, такая модель может быть хорошим способом ужать счёт за inference. Если же речь идёт о кодогенерации, многошаговом reasoning или агенте, который должен не только думать, но и делать это без мучительной паузы, низкая цена за токен уже не спасает.

Для бизнеса вывод ещё прозаичнее. Ценник сам по себе ничего не гарантирует, если модель компенсирует скидку более длинной цепочкой рассуждений. Это особенно важно в продуктах, где latency влияет на конверсию, удержание и стоимость выполнения workflow не меньше, чем прямой счёт от провайдера. Условно: если внутренний copilot отвечает вдвое дольше, сотрудники успеют заметить это раньше, чем финансовый отдел порадуется экономии в несколько центов. На рынке LLM всё чаще продают не «самый умный» и не «самый дешёвый» вариант, а разный баланс между точностью, скоростью и ценой. И GLM-5.3-Flash хорошо показывает, что этот баланс нельзя читать по прайсу без нагрузки из реальных задач.

История с GLM-5.3-Flash в итоге не про то, что одна модель лучше другой. Она про то, что рынок AI всё активнее маскирует инженерный компромисс маркетинговой формулой «дешевле и не хуже». Для команд, которые выбирают модель под прод, вопрос теперь звучит жёстче: вы покупаете интеллект по цене токена или по времени, за которое он приносит результат.

Поделиться: Telegram X LinkedIn