llm

Google ускорила Gemma 4 до 3 раз без потери качества
Gemma 4 с multi-token prediction, по данным InfoQ, ускоряет генерацию токенов почти в 3 раза без потери качества на ПК,…

Google обновила Android Bench: GPT-5.5 вышла в лидеры
GPT-5.5 заняла первое место в Android Bench от Google, но запуск тестового прогона обходится в $133,9 против $49 у Gemini…

AI-харнесы меняют рынок ИИ быстрее, чем сами модели
OpenClaw и Claude Code превратили один запрос к LLM в десятки шагов. Это меняет требования к моделям, серверам и экономике…
Почему AI Governance стал задачей архитектора, а не юристов
В 2026 году AI Governance вышел из зоны compliance и стал инженерной задачей: guardrails, контроль ответов и риск-менеджмент теперь нужны…
«Архитех ИИ» запустила KodikRouter для доступа к 300+ LLM
14 мая 2026 года «Архитех ИИ» представила KodikRouter — российский API-шлюз для доступа к 300+ LLM с учетом требований 152-ФЗ.

Как оптимизация кеширования LLM экономит $0,02 на сообщении
Уменьшите затраты на анализ AI-сообщений с помощью кеширования. Узнайте, как pgvector оптимизирует потоки данных.

Cloudflare запустил высокопроизводительную инфраструктуру для LLM — быстрее и дешевле.
Cloudflare выпустил новую инфраструктуру для запуска больших AI-моделей, улучшив производительность и сократив затраты на GPU.

Исследовательская серия о LLM — детальный разбор трансформеров
Обзор архитектуры трансформеров в контексте LLM для разработчиков. Понимание правильного использования моделей поможет повысить эффективность.
Построение надежной инфраструктуры для оценки поведения LLM
Обсуждение основных принципов оценки и управления поведением LLM в приложениях.

Исследование LLM: параметры генерации кода и их влияние
Разбираем основные параметры оценки LLM для генерации кода: точность, задержка и способы их использования.