AI И НЕЙРОСЕТИ

Локальный ИИ на мини-ПК начал отъедать рынок облачных API

20–50 млн токенов в день на одном мини-ПК: локальный ИИ становится реальной альтернативой облачным API для задач анализа и контента.

✍️ Редакция iTech News | 19.06.2026 | ⏱ 5 мин | Источник: Tom's Hardware
🎓

Один мини-ПК с AMD Ryzen AI Max+ 395 и 96 ГБ ОЗУ может прогонять через локальный ИИ по 20–50 млн токенов в сутки. Для рынка, который привык продавать инференс по подписке и API, это неприятный сигнал: часть рабочих нагрузок уже уезжает из облака на стол разработчика или редактора.

О таком опыте сообщает Tom's Hardware. Автор издания в середине марта купил мини-ПК GMKtech примерно за £1500, или около $2000, чтобы перенести на локальные модели свою систему мониторинга новостей. Логика была предельно приземлённой: либо платить всё больше за подписки и API-вызовы, либо один раз вложиться в железо и дальше оплачивать в основном электричество.

Сценарий у него не игрушечный и не про «поговорить с ботом вечером». Система собирает RSS-потоки, загружает тексты новостей по нужным темам, сравнивает их с персональным «цифровым мозгом», собранным на базе почти 2000 его материалов за четыре года, а затем передаёт потенциально важные темы цепочке из ИИ-«репортёров» и ИИ-«редакторов». Первые читают дополнительные материалы по теме и формируют питчи, вторые спорят с ними о фрейминге и в итоге отправляют автору пару абзацев идеи через Telegram. По его оценке, качество пока ближе к выпускнику без большого опыта, чем к сильному отраслевому редактору, но как фильтр повестки и инструмент предварительной разметки это уже работает.

Технически всё собрано на LM Studio и квантованных моделях семейства Qwen, в том числе на вариантах примерно класса 9B. Выбор не самый эффектный для любителей мериться бенчмарками, зато понятный для прикладной эксплуатации: если у тебя параллельно крутятся несколько редакторских и репортёрских процессов, важнее не максимальный IQ одной модели, а пропускная способность всей схемы. Автор пишет, что после настройки BIOS смог отдать AMD-графике доступ к 96 ГБ памяти, а сами модели обрабатывают вход примерно на уровне 300 токенов в секунду. Генерация ответа заметно медленнее, около 5–10 токенов в секунду, но для фоновых задач это не критично: система работает круглосуточно, и разница между двумя секундами и двумя минутами на отдельный прогон не ломает процесс.

Главная цифра здесь не скорость, а экономика. С середины марта локально размещённые модели у автора сожгли от 20 до 50 млн токенов в день только в рамках этого проекта. Если добавить отладку на внешних сервисах и параллельные задачи, суточный объём доходит до 50–100 млн токенов. В такой конфигурации разговор про «дешёвый API» быстро заканчивается. Даже если цена за токен на бумаге снижается, реальные счета растут из-за объёма, более длинных контекстов, агентных сценариев и общего усложнения пайплайнов. Автор оценивает, что за два месяца сэкономил сумму, сопоставимую примерно с тремя четвертями стоимости первого мини-ПК, если бы гонял этот же проект через API GPT-5.4-mini. Это не универсальная смета для всех команд, а расчёт под его нагрузку, но сама тенденция видна слишком хорошо, чтобы её игнорировать.

На этом фоне особенно интересно, что он не ушёл из облака полностью. Подписки на крупные модели остались, но поменяли роль. Если раньше они были основным двигателем работы, то теперь используются как дорогой слой для отладки, tinkering-задач и помощи в программировании. По его словам, две трети и более всего потребления токенов уже приходятся на локально запущенные LLM. Для рынка это важный маркер: облачные модели не исчезают, но постепенно превращаются в премиальный инструмент для сложных случаев, а рутинный анализ, классификация, длинные фоновые чтения и внутренняя автоматизация начинают нормально жить на собственном железе.

Есть и ещё один симптом взросления сегмента. После первого устройства автор решил докупить версию на 128 ГБ памяти, причём сделал это до очередного подорожания DRAM. Причина прозаическая: текущий объём запросов уже упирался в пределы 96-гигабайтной машины, а дальше хотелось расширять проект и тестировать локальные инструменты для кодинга. Иначе говоря, речь идёт не о разовой попытке «поиграться в open source вместо OpenAI», а о нормальном capacity planning, где память, пропускная способность и стоимость токена считаются почти так же скучно, как в любом другом продакшн-контуре.

Для русскоязычной IT-аудитории здесь сразу несколько практических выводов. Разработчикам и продуктовым командам этот кейс напоминает, что локальный ИИ уже годится не только для демо и приватных экспериментов, но и для тяжёлых фоновых задач с миллионами токенов в день, если качество frontier-моделей не является обязательным. IT-директорам он подсказывает, что TCO надо считать не по рекламным тарифам, а по реальным сценариям: с агентами, длинными промптами, многократными прогонами и человеческим контролем. А стартапам и медиа-командам он показывает неприятную для облачных провайдеров вещь: как только рабочий процесс терпит задержку и не требует идеального ответа с первого раза, локальная инфраструктура начинает выглядеть не экзотикой, а способом вернуть себе контроль над юнит-экономикой.

Открытый вопрос теперь не в том, заменит ли локальный ИИ облако целиком. Скорее рынок подходит к более скучной и потому более зрелой модели: дешёвый массовый инференс, внутренние пайплайны и асинхронные агенты уходят на собственные машины, а облачные API остаются для пиков, сложного кодинга и задач, где цена ошибки выше цены токена. Если цены у провайдеров продолжат ползти вверх, а открытые модели и потребительское железо ещё немного подтянутся, мини-ПК с LLM рискуют стать для части команд таким же обычным инструментом, как NAS, локальный CI-сервер или стенд для тестов.

Поделиться: Telegram X LinkedIn