Cloudflare не «ускорил свои модели Kimi и GLM» — и это уже первая правка. Kimi и GLM принадлежат Moonshot AI и Z.ai, а Cloudflare оптимизирует инфраструктуру Workers AI, на которой эти большие модели работают. По данным компании, после доработки своего inference-движка Infire Cloudflare сделал Kimi K2.5 в три раза быстрее, а заодно снизил стоимость крупных агентных сценариев.
Для разработчиков это важнее красивого графика в блоге: речь о том, можно ли держать длинный контекст и сложные AI-агенты без счёта на миллионы долларов в год.
Cloudflare оптимизирует не модели, а их запуск
В исходном тексте смешаны две разные сущности: сами LLM и платформа, которая их обслуживает. Cloudflare пишет, что Workers AI научился запускать extra-large open-source модели, начиная с Moonshot AI Kimi K2.5, а ключевую роль здесь играет собственный inference-движок Infire на Rust.
Компания утверждает, что Kimi K2.5 после оптимизаций стал работать в три раза быстрее. Дополнительно Infire даёт до 20% более высокой пропускной способности в токенах в секунду на системах без жёстких ограничений по ресурсам и может начать обслуживать запросы к крупной модели менее чем за 20 секунд после запуска.
Почему Kimi K2.5 вообще тяжело обслуживать
Kimi K2.5 — это не компактная модель для ноутбука. По данным Cloudflare, у неё более 1 трлн параметров и около 560 ГБ весов, поэтому для запуска нужно как минимум восемь GPU Nvidia H100, не считая памяти под KV-cache.
Cloudflare отдельно подчёркивает, что оптимизировал многографический режим, работу с KV-cache и cold start. Иначе такие модели быстро упираются не в «магический AI», а в скучную физику: память заканчивается раньше, чем маркетинг успевает написать слово frontier.
Экономика меняется сильнее, чем кажется
Самый полезный фрагмент у Cloudflare не про архитектуру, а про деньги. Компания пишет, что её внутренний агент для проверки безопасности кода обрабатывает более 7 млрд токенов в день, а переход на Kimi в Workers AI сократил оценочную стоимость такого сценария на 77% по сравнению с проприетарной моделью среднего уровня. В одном кодовом базе этот агент нашёл более 15 подтверждённых проблем.
Это уже не история про «ещё одну модель в каталоге». Это история про то, как open-source LLM начинают отъедать практические сценарии у закрытых конкурентов там, где раньше всё ломалось о цену.
GLM здесь скорее пример следующей волны
Упоминание GLM в черновике тоже требует уточнения. В апрельской заметке Cloudflare про ускорение речь шла именно о Kimi K2.5. Модель GLM-5.2 Cloudflare добавил в Workers AI позже, в июне 2026 года: у самой модели заявлено окно контекста до 1 048 576 токенов, но в сервисе Cloudflare она стартовала с лимитом 262 144 токена.
То есть связка Kimi + GLM в одном заголовке без пояснений вводит читателя в заблуждение. Корректнее говорить так: Cloudflare строит инфраструктуру для очень больших open-source моделей, а Kimi стал первым публичным кейсом с конкретными метриками ускорения.
Значение для рынка
Для русскоязычных команд вывод простой: если вы строите AI-агентов, длинные цепочки tool calling или кодовых помощников, главным узким местом становится не качество модели, а стоимость и скорость inference. И если Cloudflare, Vercel и другие платформы научатся стабильно запускать Kimi, GLM и похожие модели дешевле закрытых API, то часть продуктовых и корпоративных команд начнёт считать ROI уже не в пользу «самого известного бренда», а в пользу более дешёвого open-source стека.
Оригиналы: Cloudflare о запуске extra-large LLM, Cloudflare о Kimi K2.5 в Workers AI, Cloudflare о GLM-5.2 в Workers AI.
Следующий шаг очевиден: если Cloudflare покажет такие же прозрачные цифры уже по GLM и новым Kimi, рынок начнёт сравнивать не только модели, но и инфраструктуру вокруг них.