РАЗРАБОТКА

Cloudflare ускорил Kimi K2.5 в три раза на Workers AI

Cloudflare оптимизировал Kimi и GLM, увеличив их продуктивность на 41% и снизив затраты на 30%.

✍️ Редакция iTech News | 23.09.2025 | ⏱ 3 мин | Источник: Cloudflare Blog
Cloudflare повысил исходную продуктивность Kimi и GLM

Cloudflare не «ускорил свои модели Kimi и GLM» — и это уже первая правка. Kimi и GLM принадлежат Moonshot AI и Z.ai, а Cloudflare оптимизирует инфраструктуру Workers AI, на которой эти большие модели работают. По данным компании, после доработки своего inference-движка Infire Cloudflare сделал Kimi K2.5 в три раза быстрее, а заодно снизил стоимость крупных агентных сценариев.

Для разработчиков это важнее красивого графика в блоге: речь о том, можно ли держать длинный контекст и сложные AI-агенты без счёта на миллионы долларов в год.

Cloudflare оптимизирует не модели, а их запуск

В исходном тексте смешаны две разные сущности: сами LLM и платформа, которая их обслуживает. Cloudflare пишет, что Workers AI научился запускать extra-large open-source модели, начиная с Moonshot AI Kimi K2.5, а ключевую роль здесь играет собственный inference-движок Infire на Rust.

Компания утверждает, что Kimi K2.5 после оптимизаций стал работать в три раза быстрее. Дополнительно Infire даёт до 20% более высокой пропускной способности в токенах в секунду на системах без жёстких ограничений по ресурсам и может начать обслуживать запросы к крупной модели менее чем за 20 секунд после запуска.

Почему Kimi K2.5 вообще тяжело обслуживать

Kimi K2.5 — это не компактная модель для ноутбука. По данным Cloudflare, у неё более 1 трлн параметров и около 560 ГБ весов, поэтому для запуска нужно как минимум восемь GPU Nvidia H100, не считая памяти под KV-cache.

Cloudflare отдельно подчёркивает, что оптимизировал многографический режим, работу с KV-cache и cold start. Иначе такие модели быстро упираются не в «магический AI», а в скучную физику: память заканчивается раньше, чем маркетинг успевает написать слово frontier.

Экономика меняется сильнее, чем кажется

Самый полезный фрагмент у Cloudflare не про архитектуру, а про деньги. Компания пишет, что её внутренний агент для проверки безопасности кода обрабатывает более 7 млрд токенов в день, а переход на Kimi в Workers AI сократил оценочную стоимость такого сценария на 77% по сравнению с проприетарной моделью среднего уровня. В одном кодовом базе этот агент нашёл более 15 подтверждённых проблем.

Это уже не история про «ещё одну модель в каталоге». Это история про то, как open-source LLM начинают отъедать практические сценарии у закрытых конкурентов там, где раньше всё ломалось о цену.

GLM здесь скорее пример следующей волны

Упоминание GLM в черновике тоже требует уточнения. В апрельской заметке Cloudflare про ускорение речь шла именно о Kimi K2.5. Модель GLM-5.2 Cloudflare добавил в Workers AI позже, в июне 2026 года: у самой модели заявлено окно контекста до 1 048 576 токенов, но в сервисе Cloudflare она стартовала с лимитом 262 144 токена.

То есть связка Kimi + GLM в одном заголовке без пояснений вводит читателя в заблуждение. Корректнее говорить так: Cloudflare строит инфраструктуру для очень больших open-source моделей, а Kimi стал первым публичным кейсом с конкретными метриками ускорения.

Значение для рынка

Для русскоязычных команд вывод простой: если вы строите AI-агентов, длинные цепочки tool calling или кодовых помощников, главным узким местом становится не качество модели, а стоимость и скорость inference. И если Cloudflare, Vercel и другие платформы научатся стабильно запускать Kimi, GLM и похожие модели дешевле закрытых API, то часть продуктовых и корпоративных команд начнёт считать ROI уже не в пользу «самого известного бренда», а в пользу более дешёвого open-source стека.

Оригиналы: Cloudflare о запуске extra-large LLM, Cloudflare о Kimi K2.5 в Workers AI, Cloudflare о GLM-5.2 в Workers AI.

Следующий шаг очевиден: если Cloudflare покажет такие же прозрачные цифры уже по GLM и новым Kimi, рынок начнёт сравнивать не только модели, но и инфраструктуру вокруг них.

Поделиться: Telegram X LinkedIn