AI И НЕЙРОСЕТИ

Perplexity вынесла контроль над AI-агентом из модели

Perplexity запустила Portable Computer на Nvidia DGX Spark: локальный AI-агент отделяет рассуждение от прав на действие.

✍️ Редакция iTech News | 27.08.2026 | ⏱ 5 мин | Источник: The New Stack
🌐

Perplexity выпустила Portable Computer, и это не просто еще один локальный AI-агент для работы с файлами и кодом. Система запускается на Nvidia DGX Spark и строится на довольно трезвой идее: модель может предлагать следующий шаг, но право реально что-то сделать получает не она, а отдельный программный контур. Для корпоративного ИТ это важнее, чем очередной спор о том, у кого умнее LLM: если агент должен читать внутренние документы, трогать GitHub, почту и корпоративные данные, бизнесу нужен не «самый сообразительный помощник», а предсказуемый механизм контроля.

Об этом как пишет The New Stack, Perplexity говорит уже не в жанре красивой демки, а как о конкретной архитектуре продукта. Portable Computer работает локально на рабочей станции Nvidia DGX Spark, которая стартует от 4700 долларов. В качестве моделей используются Qwen 3.8 27B и PPLX 27B, постобученная версия той же базы. Важно не только то, что агент крутится на устройстве клиента, но и то, что локально работают оркестратор, планировщик, маршрутизация инструментов, очередь задач и локальный поисковый индекс. Если задаче все же нужен внешний мир, например веб, браузерные действия или более сильная reasoning-модель, система может поднять запрос в облако, но только после явного разрешения пользователя.

Главная инженерная мысль здесь в другом. Большинство платформ для AI-агентов пытаются лечить ненадежность ростом интеллекта: добавить еще одну модель-планировщик, модель-критик, еще один слой проверки, еще чуть-чуть промптов и, вероятно, немного надежды. Perplexity пошла по более скучному, а значит более взрослому пути. Вероятностная модель предлагает следующее действие, а детерминированный код решает, можно ли это действие исполнять. Компания называет этот слой orchestrator, но в данном случае речь не о «модели-менеджере», а о программном рантайм-контроллере, который собирает контекст, применяет политики и запускает только разрешенные tool calls в песочнице уровня ОС. Вице-президент Perplexity по Computer Enterprise and Infrastructure Нейт Капп прямо сказал The New Stack, что именно harness, то есть обвязка и среда исполнения, съели основную часть инженерной работы.

Это различие кажется академическим ровно до первого разговора с безопасниками или CIO. Когда права доступа контролируются не еще одним текстовым указанием модели в духе «пожалуйста, не делай ничего опасного», а внешним исполнимым слоем, меняется сама точка доверия. По данным The New Stack, песочница Perplexity ограничивает процессы, доступ к файловой системе и сетевые обращения. Если sandbox недоступен, harness просто отключает выполнение до любого вызова инструмента. Это не делает систему магически неуязвимой: детерминированный код тоже может содержать баги, а разрешенное действие тоже может оказаться ошибочным. Но для корпоративной эксплуатации это уже знакомая территория. Политики можно инспектировать, поведение можно проверять, а отказ переводится из категории «LLM опять решила проявить креативность» в категорию обычной инженерной дисциплины.

Perplexity подкрепляет тезис внутренними тестами, и здесь как раз видна ставка не на новые веса, а на систему вокруг них. На собственном наборе из 53 задач Local Knowledge Work Bench компания получила 82,6% для Computer против 77,6% у Pi и 74% у Hermes при одном и том же железе Nvidia DGX Spark и той же базовой модели Qwen3.8-27B. На ParseBench-100, где проверяются диаграммы, макеты, таблицы и форматирование, разрыв еще заметнее: 65,1% у Computer против 34,6% у Hermes и 13,9% у Pi. После посттрейна Qwen в PPLX 27B показатель вырос до 85,4%. Тут важно не перепутать маркетинг с сутью. Эти цифры сообщил сам вендор, а бенчмарк пока не открыт. Но сам характер сравнения показателен: если при одинаковых весах и одинаковом железе выигрывает одна связка, значит прибавка идет не только от модели, а от того, как она упакована, ограничена и подключена к инструментам.

Есть и менее гламурная, но куда более практичная деталь: длинный контекст не решает все. Perplexity сообщает, что Qwen3.8-27B заявляет окно в 260 тысяч токенов, но заметно сдает после отметки в 100 тысяч. Поэтому компания держит базовый промпт и набор инструментов компактными, а навыки и коннекторы подтягивает по требованию. Часть популярных интеграций вообще перевели в формат командной строки, вместо того чтобы постоянно тащить в контекст полные описания через Model Context Protocol. Для разработчиков и платформенных команд это важный сигнал. Следующий виток agentic stack, похоже, будет соревноваться не только качеством reasoning, но и тем, кто лучше умеет экономить контекст, дозировать привилегии и упрощать runtime.

При этом Perplexity не делает вид, что локальная модель внезапно стала всесильной. На Terminal Bench 2.1 локальный запуск показал 59,6%. Когда агенту разрешили консультироваться с Claude Opus 5, результат вырос до 73%, но все равно остался ниже, чем у Opus 5 в одиночку с его 82,4%. Это, пожалуй, самый честный кусок всей истории. Локальный AI-агент хорош не потому, что всегда сильнее облачного, а потому, что позволяет разделить чувствительные данные и дорогое reasoning. Конфиденциальные файлы, аудио и внутренние документы остаются на устройстве, а наружу уходит только тот шаг, который пользователь разрешил отправить. Для российских команд, особенно работающих с закрытыми кодовыми базами, договорами, внутренней аналитикой и требованиями к изоляции данных, такой гибрид выглядит куда ближе к реальной эксплуатации, чем очередной чат-бот «для всего сразу».

В этой истории самое интересное даже не железо Nvidia и не очередная гонка локальных моделей. Вопрос теперь звучит иначе: кто именно в агентной системе обладает властью, модель или проверяемый исполняющий слой. Если рынок примет логику Perplexity, корпоративные AI-агенты будут оценивать не по тому, насколько красиво они рассуждают в демо, а по тому, насколько жестко они отделяют интеллект от полномочий. И это уже разговор не про магию LLM, а про зрелость платформы. Подробнее о подходе Perplexity пишет The New Stack.

Поделиться: Telegram X LinkedIn