Open weight модели нельзя автоматически называть open source, считает CEO Percona: опубликованные веса нейросети — лишь одна часть технологии, а не полный набор прав и материалов для её изучения, изменения и воспроизводства. Для российских команд, которые выбирают LLM для корпоративных продуктов, эта разница влияет не на терминологию, а на аудит лицензий, риски поставщика и стоимость внедрения.
О позиции главы Percona сообщает The New Stack. Поводом стала привычка рынка описывать почти любую модель с доступными параметрами как «открытую». Но формула «веса можно скачать» не отвечает на несколько критичных вопросов: можно ли использовать модель коммерчески, известны ли данные обучения, опубликован ли код пайплайна и разрешено ли создавать производные версии без дополнительных ограничений.
Веса — это параметры, полученные моделью после обучения. Их публикация позволяет запустить уже готовую нейросеть локально, разместить её в собственной инфраструктуре, иногда дообучить или квантовать под более скромное железо. Это ценно для компаний, которые не хотят отправлять чувствительные данные во внешний API или зависеть от тарифов одного облачного провайдера. Но сами по себе веса не дают возможности повторить обучение модели и проверить, откуда взялись её знания и ограничения.
Под open source обычно понимают более широкую модель открытости: доступный исходный код и лицензия, которая определяет права на использование, изучение, модификацию и распространение. В ИИ к этому набору добавляются датасеты, документация по подготовке данных, рецепты обучения, настройки, код оценки качества и сведения об инфраструктуре. На практике полностью воспроизводимые модели встречаются заметно реже, чем проекты с открыто опубликованными весами.
Именно здесь маркетинговая формулировка начинает вредить. Разработчик может увидеть слово «open», скачать модель и предположить, что она свободна для любого сценария. Затем выясняется, что лицензия ограничивает коммерческое использование, запрещает отдельные категории задач, требует принять дополнительные условия или не позволяет распространять модифицированную версию. Для прототипа это может быть терпимым компромиссом. Для продукта банка, интегратора или SaaS-компании — потенциальной проблемой на этапе юридической проверки.
Различие между понятиями важно и для технических команд. Если доступны только веса, инженеры могут развернуть inference, построить RAG-систему, адаптировать модель с помощью дообучения и измерить её качество на внутренних тестах. Однако они не смогут надёжно воспроизвести исходную модель с нуля или проверить все решения, которые повлияли на её поведение. Без состава обучающих данных и методики фильтрации сложнее оценить риски утечек, предвзятости, нарушений авторских прав и соответствия отраслевым требованиям.
Для CIO и продактов это означает, что вопрос «модель открытая?» лучше заменить коротким чек-листом. Какие именно артефакты опубликованы? Какая лицензия действует на веса и код? Разрешены ли коммерческое использование, дообучение и распространение? Можно ли эксплуатировать решение без внешнего сервиса? Есть ли документация о данных, тестировании и известных ограничениях? Ответы на эти вопросы дают гораздо больше, чем ярлык open source в презентации вендора.
Вокруг LLM уже сложился спектр открытости, а не простое деление на закрытые и свободные решения. На одном конце находятся модели, доступные только через API; на другом — проекты, где можно изучить код, данные и процесс обучения. Между ними располагаются open weight модели с разными условиями доступа. Такая классификация менее удобна для рекламного баннера, зато полезнее для архитектурного решения: она помогает заранее понять, что команда сможет контролировать через год, а что останется зависимостью от автора модели.
Термины важны ещё и для сообщества open source. Когда модель с ограниченной лицензией называют полностью открытой, ожидания пользователей расходятся с реальностью, а привычные слова теряют точность. Это не спор о чистоте определений: разработчики тратят время на интеграцию, юристы — на согласования, а бизнес — на пересмотр планов после обнаружения ограничений.
Вероятно, рынок будет всё чаще описывать модели по составу открытых компонентов, а не одним словом «open». Для пользователей это хороший сдвиг: выбирать придётся не между «открытой» и «закрытой» LLM, а между конкретными правами, доступными артефактами и уровнем контроля над системой. Исходную позицию CEO Percona можно проверить в материале .