AMD Gorgon Halo получила до 192 ГБ общей памяти и первые публичные результаты работы с генеративными моделями за несколько дней до ожидаемного запуска устройств Nvidia RTX Spark. Для разработчиков и компаний, которые хотят запускать крупные LLM локально, это важнее очередного сравнения TOPS: AMD делает ставку на объём модели, который вообще поместится в машину, а не только на пиковую скорость генерации.
AMD опубликовала бенчмарки Ryzen AI Max+ Pro 495 — старшего чипа линейки Gorgon Halo, сообщает Tom's Hardware. Формально компания сравнила его с Intel Core Ultra X9 388H, а не с будущим решением Nvidia: полноценных независимых результатов RTX Spark пока нет. Но адресат презентации очевиден. Nvidia должна показать устройства RTX Spark на мероприятии Microsoft 7 октября, а Gorgon Halo AMD позиционирует как прямого конкурента для компактных систем локального ИИ.
В тестах ComfyUI AMD использовала систему с Ryzen AI Max+ Pro 495 и 192 ГБ памяти. Конкурирующий Core Ultra X9 388H тестировался в конфигурации с 64 ГБ, хотя платформа Panther Lake поддерживает до 128 ГБ. Производитель заявил преимущество от 1,1 до 32,2 раза в зависимости от модели. Верхняя цифра выглядит особенно спорно: упомянутая в материалах модель Yuve не нашлась в публичном каталоге Hugging Face, поэтому понять, идёт ли речь об удачной оптимизации или о задаче, которую система Intel просто не смогла выполнить, невозможно.
Главный аргумент — не скорость, а память
Ключевое изменение в AMD Gorgon Halo по сравнению с прошлогодней Strix Halo — потолок общей памяти: 192 ГБ вместо 128 ГБ. У Ryzen AI Max+ Pro 495 также на 100 МГц выше максимальная частота, но число ядер и микроархитектуры остались прежними. Это скорее аккуратное обновление знакомой платформы, чем новый класс железа. Первые устройства уже продаются: например, топовая конфигурация Minisforum MS-S1 Max-P495 стоит около 7099 долларов.
Дополнительные 64 ГБ позволяют держать локально модели, которые в 128 ГБ не влезают без агрессивного сжатия, выгрузки частей в оперативную память или распределения нагрузки по нескольким узлам. Это имеет практический смысл для команд, работающих с закрытым кодом, внутренними документами, персональными данными и офлайн-сценариями. В таких задачах облачный API бывает дешевле на старте, но не всегда проходит по требованиям безопасности, задержке или предсказуемости расходов.
Однако большой объём памяти не превращает компактную рабочую станцию в ускоритель для дата-центра. AMD сообщила о пиковых 20 токенах в секунду при работе с GLM 5.3 Flash — моделью на 320 млрд параметров, из которых на один токен активируются 18 млрд. Результат получен с форматом смешанной квантизации Unsloth UD-IQ4_XS. Для мультимодальной Qwen 3.8 Flash Next компания заявила до 42 токенов в секунду с динамической 4-битной квантизацией и MTP. Слово «до» здесь делает немалую работу: с ростом контекста скорость неизбежно снижается, а именно длинный контекст отличает реальную работу с документами и агентами от красивого демо после холодного старта.
Насколько убедительна позиция AMD
Сравнение с уже известными системами оставляет для AMD неудобный вопрос. В тестах Tom's Hardware прошлое поколение Ryzen AI Max+ 395 уступало Nvidia DGX Spark и по времени до первого токена, и по скорости генерации на нескольких моделях. Для ориентира: DGX Spark в тесте с GPT-OSS 120B при 4-битной квантизации достигал 64 токенов в секунду, а Ryzen AI Max+ 395 — 56. Эти цифры нельзя механически переносить на GLM 5.3 Flash: модели, квантизация и число активных параметров различаются. Но они показывают, почему 192 ГБ памяти — сильный, хотя и не исчерпывающий аргумент.
AMD также уточнила масштаб нового сегмента. Компания сначала говорила о десятках миллионов отгруженных AI PC — в широком смысле ноутбуков с ИИ-функциями, — но для так называемых agentic PC назвала показатель свыше полумиллиона устройств. Это заметно меньше хайпа вокруг локальных агентов, но уже не единичная ниша для энтузиастов. Для российского рынка, где доступ к облачным моделям и зарубежным API может быть нестабилен, такие мини-станции потенциально интересны интеграторам, студиям разработки и компаниям с чувствительными данными. Правда, ценник около 7 тыс. долларов пока оставляет их скорее инструментом для пилотов и узких профессиональных сценариев.
Ближайшая интрига — не в максимальном размере модели, а в том, как RTX Spark покажет себя на длинных контекстах, в реальных агентных цепочках и при сопоставимых настройках квантизации. AMD Gorgon Halo уже обозначила свою позицию: локально можно запустить больше. Nvidia ещё предстоит ответить, насколько быстро и экономично эти модели будут работать в устройстве, которое действительно можно купить.