AI И НЕЙРОСЕТИ

SEMQ предлагает снизить нагрузку ИИ без грубой квантизации

SEMQ в тесте дал 92,27% точности против 92,26% у FP32 и заметно обошел 4-битную квантизацию, предлагая иной способ экономить ресурсы ИИ.

✍️ Редакция iTech News | 01.07.2026 | ⏱ 5 мин | Источник: The Register
🧬

Исследовательский проект SEMQ предлагает пересобрать привычную экономику AI-инфраструктуры: не ужимать эмбеддинги все сильнее, а отделить их смысловую часть от численного представления. Для команд, которые считают каждый гигабайт памяти и каждый сервер под retrieval-нагрузку, это может быть важнее очередного спора про то, какая квантизация моделей меньше портит ответы.

Об этом сообщает The Register со ссылкой на Андреса Мака Аллистера, основателя и CEO The SEMQ Group. Его идея называется Symbolic Embedding Multi-Quantization, или SEMQ. Если совсем по делу, речь не о еще одном формате хранения весов, а о попытке вынести семантику в отдельный слой абстракции: сохранить отношения между векторами, их взаимное положение и соседство, но не тащить за собой весь груз высокоточной числовой записи.

Проблема, на которую нацелился SEMQ, хорошо знакома любому, кто разворачивал модели локально или хотя бы считал бюджет на inference. Параметры модели обычно хранятся в формате FP32, то есть по 4 байта на параметр. Для модели на 7 млрд параметров это около 28 ГБ памяти и диска. Перевод в FP16 или BF16 сокращает объем примерно до 14 ГБ. Дальше начинаются знакомые компромиссы: FP8, INT8, Q6, Q5, Q4, Q3, Q2. Места становится меньше, но вместе с ним обычно уходит и точность. Именно поэтому квантизация моделей, какой бы полезной она ни была, редко воспринимается как бесплатный обед.

Подход SEMQ пытается срезать путь в другом месте. Мак Аллистер исходит из того, что для семантических задач важнее не абсолютные значения координат вектора, а их относительная геометрия: направление, порядок близости, структура соседства, устойчивость похожих объектов в пространстве признаков. Иными словами, если системе нужно понимать, что два текста близки по смыслу, ей часто важнее не каждая цифра по отдельности, а то, как объекты расположены относительно друг друга. На этом тезисе и строится идея symbolic embedding: вместо сырых векторов использовать фиксированные символические структуры, которые сохраняют семантические отношения, но отвязывают их от конкретного способа хранения, индексации и выполнения операций.

На бумаге это звучит как типичная попытка продать “не просто сжатие, а философию”. Но в материале есть и цифры. В одном из первых тестов использовали датасет Banking77 из MTEB и модель эмбеддингов all-MiniLM-L6-v2. Базовая точность FP32 составила 92,26%. Формат SEMQ показал 92,27%, то есть фактически повторил результат исходного представления. Для сравнения, 4-битная квантизация в том же сценарии дала 56,05% точности. Разрыв с FP32 составил 36,22 процентного пункта. Это не доказывает, что традиционная квантизация моделей плоха всегда и везде, но довольно жестко показывает: в задачах семантической классификации потеря “лишних” чисел и потеря структуры смысла — не одно и то же.

Практический аргумент у SEMQ тоже понятный. По словам Мак Аллистера, технологию можно применять либо на этапе загрузки данных, когда компания берет эмбеддинги, сгенерированные своей моделью для документов, и кодирует их в артефакт формата .semq, либо уже во время запросов — для загрузки, сравнения, восстановления и верификации такого представления. То есть менять LLM, embedding-модель, векторную базу или агентный фреймворк не требуется. SEMQ можно поставить как sidecar-слой рядом с текущим стеком и сначала использовать на отдельных retrieval- или memory-нагрузках. Для корпоративных команд это, пожалуй, главный крючок: меньше шансов услышать от архитектурного комитета сакраментальное “интересно, но переписывать все мы, конечно, не будем”.

Если смотреть шире, проект попадает ровно в ту зону, где AI-инфраструктура у многих компаний начинает расползаться. Отдельно живут эмбеддинги, отдельно векторные базы, отдельно память агентов, отдельно пайплайны индексации, которые трудно воспроизвести даже внутри одной команды, не говоря уже о переносе между средами. SEMQ обещает здесь не только экономию ресурсов, но и переносимость семантического состояния: возможность воспроизводить его на другой машине, сравнивать версии, аудитить изменения модели, уменьшать зависимость от непрозрачных stateful-пайплайнов и буквально делать diff для смыслового состояния. Для regulated-среды, enterprise-поиска и систем, где важно объяснить, почему retrieval сегодня вернул один набор документов, а завтра другой, это уже не академическое упражнение.

Отдельно интересен намек на работу не только с эмбеддингами, но и с runtime-состоянием моделей. В исследовании, как утверждает Мак Аллистер, .semq-файлы использовали для снимков и восстановления KV-cache трансформеров через границы процессов. Если это удастся довести до промышленного сценария, разговор пойдет уже не только про хранение смысловых представлений документов, но и про перенос, паузу и возобновление активных сессий модели. Для агентных систем, long-running workflow и распределенного inference это звучит заметно интереснее, чем просто “еще один формат сжатия”.

Коммерческая стадия пока ранняя. The SEMQ Group работает через программу founding design partners с компаниями, которые изучают применение технологии в enterprise AI, retrieval, памяти агентов и аудируемых AI-процессах. Мак Аллистер говорит, что среди заинтересованных есть и hyperscaler-инфраструктура, и игроки прикладного уровня, но конкретные названия не раскрывает из-за NDA. В переводе с корпоративного на человеческий это значит простую вещь: интерес есть, но рынок еще смотрит, можно ли превратить красивую геометрию в воспроизводимый продукт с понятной интеграцией и предсказуемым профилем ошибок.

Для отрасли здесь важен более общий сигнал. Несколько последних лет оптимизация AI в основном шла по знакомым рельсам: уменьшать precision, экономить VRAM, подбирать компромисс между ценой и деградацией качества. SEMQ предлагает спорный, но любопытный разворот: возможно, узкое место не только в том, насколько точно мы храним числа, а в том, что именно мы вообще считаем обязательным хранить. Если эта логика выдержит больше независимых тестов, разговор про эффективность AI-систем постепенно уйдет от одной только квантизации моделей к архитектуре семантического состояния как отдельного слоя инфраструктуры. Проверить исходные детали и цитаты можно в материале The Register.

Поделиться: Telegram X LinkedIn