AI И НЕЙРОСЕТИ

Perplexity и Nvidia запустили локального AI-агента без платы за токены

Perplexity 25 августа запустила Portable Computer: локальный AI-агент работает на RTX GPU с 24 ГБ VRAM и не тратит облачные токены.

✍️ Редакция iTech News | 26.08.2026 | ⏱ 6 мин | Источник: VentureBeat
🧠

Perplexity вместе с Nvidia вывела локальный AI-агент из категории «поиграться вечером с Ollama» в более взрослую лигу. Новый Portable Computer запускает агентную платформу Perplexity прямо на машине пользователя, требует RTX-видеокарту с минимум 24 ГБ VRAM и, если задача выполняется локально, не сжигает ни одного облачного токена. Для русскоязычной IT-аудитории это важный сигнал: рынок начинает продавать не просто модели, а полноценные локальные рабочие места для ИИ-автоматизации.

О запуске 25 августа 2026 года сообщает VentureBeat. Речь идет о локальной версии платформы Perplexity Computer, которая умеет разбирать документы, анализировать данные, собирать отчеты и работать в несколько шагов, используя модели, файлы, инструменты и веб-доступ. Теперь этот стек можно поднять не в облаке, а на собственном железе: сначала на настольном суперкомпьютере Nvidia DGX Spark и на Linux-машинах с RTX GPU. Windows-версию Perplexity обещает в сентябре.

Главная идея Portable Computer довольно прагматична: Perplexity не продает очередной «локальный inference-сервер», а упаковывает в одно приложение почти весь стек, который обычно приходится собирать руками. Внутри есть локальная модель, агентный runtime, inference-движок, инструменты, коннекторы и песочница безопасности. На практике это попытка закрыть главный барьер локального ИИ 2025-2026 годов: модель у разработчика уже запускается, а вот надежный агент поверх нее все еще напоминает конструктор из несовместимых деталей. Для стартапов, внутренних команд автоматизации и security-sensitive компаний это, возможно, даже важнее самих моделей.

Стартовые конфигурации тоже названы без тумана. На запуске доступны Qwen 3.8 27B и PPLX 27B, то есть версия модели, дополнительно дообученная Perplexity под собственную агентную обвязку. В очереди стоит Nemotron 3.5 Lightning от Nvidia. Минимальный порог по железу тоже обозначен прямо: любая RTX-карта с 24 ГБ видеопамяти, примерно от GeForce RTX 3090 и новее. И здесь есть первый холодный душ: массовый потребительский ноутбук в эту историю пока не попадает. Это не «ИИ для всех на домашнем ПК», а скорее локальный AI-агент для тех, у кого уже есть серьезная рабочая станция или бюджет на нее.

Локальность здесь не про романтику, а про деньги и контроль

Perplexity и Nvidia довольно точно попали в нерв рынка. Обычный чат потребляет токены короткими всплесками: вопрос, ответ, пауза. Агентный режим работает иначе. Он может часами читать папки с документами, перепроверять промежуточные шаги, запускать инструменты и возвращаться к задаче снова и снова. В облаке такой сценарий быстро превращается в счет, который неприятно показывать финансовому директору. На локальной машине предельная стоимость инференса становится близкой к нулю: железо уже куплено, а счетчик токенов стоит на месте.

Именно поэтому в демонстрациях Perplexity делала акцент не на красоте интерфейса, а на типах задач. В одном сценарии агент разбирал налоговые и инвестиционные документы частного инвестора и искал лишние комиссии. В другом — анализировал CSV с воронкой продукта и отправлял результат в Slack. То есть Portable Computer метит не в область «поболтать с моделью офлайн», а в чувствительные рабочие процессы, где компании не хотят выгружать файлы в облако, но хотят агентный UX. Для финтеха, юркоманд, healthcare и корпоративной аналитики это уже не игрушка, а потенциальный аргумент в закупке.

При этом Perplexity не обещает магии уровня frontier-моделей на одной видеокарте. Компания честно оставляет гибридный сценарий: каждая задача стартует локально, а если локальная модель не вытягивает отдельный шаг, система запрашивает разрешение на обращение к более сильной облачной модели. Перед таким вызовом прогоняется классификатор PII, а пользователю показывают, какой именно контекст покинет устройство. Важно и другое: удаленная модель получает только текстовую подсказку и не трогает локальные файлы или инструменты напрямую. Это уже не просто маркетинг про privacy-first, а попытка вменяемо разделить зоны риска.

Perplexity продает не модель, а агентную обвязку

Самая интересная часть анонса, пожалуй, не в продукте, а в инженерной позиции компании. Вместе с релизом Perplexity выпустила исследовательскую работу, где утверждает довольно неудобную для open-source-сцены вещь: маленькие локальные модели плохо переносят те же агентные фреймворки, которые более-менее работают с облачными frontier-моделями. Причина проста. Большой удаленный ИИ еще может переварить гигантский контекст, россыпь инструментов и длинный горизонт планирования. Локальная 27B-модель начинает задыхаться гораздо раньше. По данным Perplexity, даже если Qwen 3.8 27B заявляет окно контекста в 260 тысяч токенов, заметная деградация начинается уже после 100 тысяч.

Отсюда и архитектурные решения: короткий системный промпт, маленький набор базовых инструментов, навыки по требованию вместо постоянной загрузки в контекст, компактные CLI-инструменты там, где другие используют тяжеловесные MCP-серверы, плюс обязательная системная песочница. Если песочницы нет, агент просто не работает. На фоне многих open-source-обвязок, которые готовы запускать команды с пользовательскими правами без лишних церемоний, это выглядит не самым модным, зато взрослым решением. Для корпоративного внедрения такой подход ценнее очередной красивой демки на X.

Цифры, которые Perplexity приводит в своих тестах, выглядят сильно, хотя здесь нужен обязательный редакторский скепсис: бенчмарки внутренние. На Local Knowledge Work Bench из 53 задач связка Computer с Qwen 3.8 27B набрала 82,6% против 77,6% у Pi и 74,0% у Hermes на той же модели. Версия PPLX 27B поднялась до 85,4%. На BrowseComp разрыв еще заметнее: 66,7% против 50,2% и 43,9%, при этом система Perplexity, по ее данным, потратила на 51% меньше времени и на 70% меньше токенов, чем Pi. На multimodal document understanding результат составил 65,1% против 34,6% у Hermes и 13,9% у Pi. Все это не повод слепо верить каждой цифре, но хороший индикатор того, куда сместилась конкуренция: от «какая модель лучше отвечает» к «какой стек лучше доводит задачу до конца».

Наиболее деловой вывод дает тест Terminal Bench 2.1. Полностью локальная Qwen-модель показала 59,6% почти при нулевой предельной стоимости. Подключение облачного advisor-режима на Claude Opus 5 подняло результат до 73,0% при оценке в $0,415 на задачу. Запуск frontier-модели в одиночку дал 82,4% при $0,65 на задачу. Переводя с языка бенчмарков на язык бюджета: гибридный режим возвращает заметную долю качества облака, но не тащит за собой полный облачный ценник. Для команд, которые уже считают стоимость агентных пайплайнов не в долларах за миллион токенов, а в бюджете на функцию или отдел, это довольно сильный аргумент.

У Nvidia здесь тоже понятный интерес. Компания два года продавала миру огромные AI-ЦОДы, а теперь аккуратно подводит рынок к мысли, что часть агентной нагрузки надо закреплять на рабочем столе. DGX Spark от этого получает то, чего железу часто не хватает, — понятный сценарий использования. Вопрос в другом: насколько быстро такой локальный AI-агент спустится с дорогих RTX-конфигураций на более массовое железо и доберется до экосистемы вне Nvidia. Пока Portable Computer работает только на Linux, требует минимум 24 ГБ VRAM и вообще не обещает поддержку Apple Silicon. Но сам вектор уже задан: если облачный ИИ продавался как доступ к мощности, то следующий раунд, похоже, будет продавать контроль над мощностью. Подробности и цифры запуска собраны в материале VentureBeat.

Поделиться: Telegram X LinkedIn