инференс
Sandisk и SK hynix готовят HBF на 512 ГБ для ИИ-ускорителей
До 3,12 ТБ памяти на ускоритель: Sandisk и SK Hynix продвигают high-bandwidth flash для AI-инференса, но у идеи есть жесткие…
Nvidia раскрыла, как Rubin ускорит ИИ-инференс на уровне стойки
50 PFLOPS NVFP4 и 288 ГБ HBM4: Nvidia раскрыла, как архитектура Rubin ускоряет ИИ-инференс и снижает накладные расходы от GPU…
Kimi K3 собрал ажиотаж и уперся в дефицит GPU за 48 часов
Через 48 часов после запуска Kimi K3 Moonshot AI остановила новые подписки: спрос на модель показал, что главный дефицит в…
DeepSeek снизила цены на 75%, но экономика AI-агентов хуже не стала
DeepSeek урезала цену V4-Pro на 75%, но стоимость AI-агентов продолжает расти: токены в агентных цепочках сгорают быстрее, чем дешевеет инференс.
Экс-глава ИИ Databricks обещает сократить энергопотребление ИИ в 1000 раз
Бывший глава ИИ Databricks заявил о цели снизить энергопотребление ИИ в 1000 раз и показал Un-0 — генератор изображений на…
OpenAI и Broadcom показали Jalapeño — свой первый AI-чип
OpenAI и Broadcom 24 июня 2026 года раскрыли дизайн Jalapeño — первого совместного AI-чипа для LLM-инференса с запуском в ЦОДах…

Цены на ИИ растут: новые чипы помогут вендорам, а не клиентам
OpenAI подняла цену GPT-5.5 до $5 за вход и $30 за выход на миллион токенов. Для бизнеса это сигнал: цены…

Cloudflare сократил объём LLM на 22% без потери качества
Cloudflare разработал систему Unweight, которая позволяет сократить размер LLM на 22% при сохранении качества. Как это поможет разработчикам?