Meta выпустила Muse Glimmer — 30-миллиардную LLM и первую open weights-модель компании более чем за год. Для тех, кто строит локальный inference, агентные сценарии и корпоративных кодовых ассистентов, это важный сигнал: Meta снова пытается зайти на поле, которое сама же помогла сделать массовым, но за последние месяцы заметно уступила китайским игрокам.
Новый релиз, как пишет The Register, выглядит не как попытка сразу вернуть лидерство, а как аккуратное возвращение в игру. Muse Glimmer — это distilled-версия более крупной и пока закрытой модели Muse Spark. Meta позиционирует ее для локального запуска, мультимодальных сценариев с tool use и function calling, а также для небольших и средних компаний, которым нужен не абстрактный «фронтир», а модель, которую можно развернуть у себя и не разориться на железе.
Сам факт релиза для Meta сейчас почти важнее сухих бенчмарков. Компания заработала себе имя в open weights-сегменте на волне Llama, начиная с 2023 года. Но после неудачного приема Llama 4 и перестройки AI-подразделения у рынка возник простой вопрос: Марк Цукерберг все еще верит в открытые веса или тема закрыта? Выход Muse Glimmer — это прямой ответ: нет, не закрыта. Причем модель выпущена под лицензией Apache 2.0, а значит бизнес может свободно использовать, модифицировать и внедрять ее в свои продукты без экзотических ограничений.
По масштабу это, конечно, не тот релиз, который заставит конкурентов нервно переписывать роадмапы. На фоне китайских моделей последних месяцев 30 млрд параметров выглядят скорее как прагматичный компромисс, чем как заявка на доминирование. The Register прямо пишет, что Glimmer слишком мала, чтобы полноценно спорить с Moonshot AI Kimi K3, Alibaba Qwen 3.8-Max, DeepSeek V4 Flash и другими моделями, которые в последние месяцы задавали тон новостной повестке. Meta и сама, судя по опубликованным сравнениям, понимает свою нишу: модель тестируют не против тяжеловесов верхнего сегмента, а против Alibaba Qwen 3.6-27B и Google Gemma 4 31B.
По заявленным метрикам картина для Meta скорее приличная, чем триумфальная. Muse Glimmer в ряде сценариев обходит сопоставимую по размеру Gemma 4 и примерно на равных играет с Qwen 3.6-27B. Но это тот случай, когда дата релиза мешает праздновать слишком громко: в материале отдельно оговаривается, что Qwen 3.8-27B может выйти буквально со дня на день, и тогда сегодняшнее сравнение быстро устареет. Для технической аудитории это важный нюанс: если смотреть на модель как на базу для внутреннего ассистента или локального copilot, нужно оценивать не только текущие графики Meta, но и то, как быстро конкуренты обновляют линейки в том же размерном классе.
Практическая сторона у релиза заметно сильнее маркетинговой. В BF16 модель занимает около 60 ГБ, то есть должна помещаться на одной Nvidia RTX Pro 6000 или AMD MI350P. После 4-битной квантизации веса сжимаются примерно до 16 ГБ, и это уже диапазон потребительских карт с 20–24 ГБ памяти: RTX 3090, RTX 4090 или Radeon RX 7900 XT/XTX. Для владельцев 16-гигабайтных карт новости хуже: из-за нехватки рабочей памяти придется уходить в 3-битную квантизацию с потерей качества. Иными словами, локальный запуск реалистичен, но «полетит на любом домашнем ПК» — это не про этот релиз.
Есть и вторая инженерная оговорка: Glimmer не относится к новым сверхэкономным архитектурам, где на каждый токен активируется лишь часть параметров. Здесь модель использует все 30 млрд параметров при генерации каждого токена, поэтому по скорости она уступает некоторым свежим конкурентам того же класса, например Qwen 3.6-35B-A3B или Gemma 4 26B-A4B, у которых активная часть заметно меньше. Meta делает ставку на высокую пропускную способность памяти. На RTX 5090 компания обещает от 75 до 233 токенов в секунду, причем верхняя планка достигается со speculative decoding — техникой, где отдельная draft-модель заранее угадывает продолжение и ускоряет большую модель. На M5 Max MacBook Pro оценка составляет 26,2–57,8 токена в секунду. А вот на типичном ноутбуке без дискретной графики пользователь, по сути, получает уже совсем другой класс опыта — порядка 6–14 токенов в секунду.
Для разработчиков важен и экосистемный момент: поддержка модели уже начала появляться в Llama.cpp, Ollama и Unsloth, а значит внедрение в привычные локальные стеки не придется собирать на коленке с нуля. Для open-source-сообщества это обычно означает еще и быструю волну дообучений, форков и прикладных сборок. The Register отдельно предполагает, что Nous Research, один из ранних тюнеров Llama, вполне может выпустить новую версию Hermes на базе Glimmer. Если это случится, модель проживет не только как очередной пресс-релиз Meta, но и как сырье для практических инструментов, которые интереснее корпоративным командам, чем оригинальная «базовая» версия.
На этом Meta явно не останавливается. Глава направления Superintelligence Александr Wang пообещал «скоро» открыть weights для Muse Spark 1.2 — это уже более сильная модель из текущей линейки Meta, первая, которая, по оценке самой компании и отраслевых наблюдателей, вообще может содержательно спорить с OpenAI, Anthropic и Google. Но даже здесь интрига не в том, вернется ли Meta в open weights, а в том, сможет ли она сделать это достаточно быстро и достаточно экономно. Если следующий открытый релиз даст высокий уровень качества при меньшем числе параметров, у компании появится шанс сыграть не в гонку громких заголовков, а в более приземленную и для бизнеса куда важнее игру: стоимость токена, удобство локального запуска и контроль над моделью внутри собственной инфраструктуры.
