AI И НЕЙРОСЕТИ

Subquadratic заявила о прорыве в узком месте LLM

56-кратное ускорение в тесте Appen и окно контекста до 12 млн токенов: Subquadratic заявила, что нашла способ сделать LLM дешевле и экономнее.

✍️ Редакция iTech News | 20.06.2026 | ⏱ 4 мин | Источник: MIT Technology Review
🤖

Стартап Subquadratic из Майами утверждает, что нашел способ обойти одно из самых дорогих ограничений больших языковых моделей: в независимой проверке Appen его система показала ускорение до 56 раз, а заявленное окно контекста достигает 12 млн токенов. Для русскоязычной IT-аудитории это не академический спор, а вполне прикладной вопрос: если разреженное внимание действительно работает без заметной просадки качества, анализ больших кодовых баз, массивов документов и корпоративных знаний может стать ощутимо дешевле.

История началась в мае, когда Subquadratic вышла из стелс-режима с заявлением почти на грани приличия: компания сказала, что решила математическую проблему, которая тормозила развитие LLM почти десять лет. Доказательств тогда было немного, и реакция получилась предсказуемой. Как пишет MIT Technology Review, теперь компания начала выкладывать козыри на стол: опубликовала больше деталей о модели SubQ и результаты дополнительной оценки, которую проводила сторонняя компания Appen.

Суть претензии Subquadratic проста и потому особенно раздражает конкурентов. Большинство современных LLM построены на трансформерах и плотном механизме внимания: модель сопоставляет каждый токен со всеми остальными, чтобы уловить связи внутри текста. На коротких запросах это терпимо, но с ростом длины контекста вычисления раздуваются квадратично. Если сильно упростить, удвоили объем текста — получили примерно четырехкратный рост вычислительной нагрузки. Именно поэтому длинный контекст до сих пор стоит дорого, ест энергию без стеснения и быстро превращает красивые демо в неприятные счета за инференс.

Subquadratic предлагает заменить этот подход на разреженное внимание. Идея не новая: считать не все связи между токенами, а только те, которые действительно важны. Проблема в том, что на этом месте многие уже спотыкались. Фиксированные схемы отбора обычно режут не только вычисления, но и качество. По словам CTO Алекса Уидона, SubQ выбирает значимые связи динамически, отдельно для каждого текста, а не по заранее заданному шаблону. Подробности алгоритма компания, конечно, не раскрывает. Иначе какой же это стартап из стелса.

Пока самый убедительный аргумент не в красивой теории, а в числах. Appen прогнала SubQ через несколько стандартных тестов и, по словам директора по исследованиям генеративного ИИ Джанин Синанан-Сингх, результаты подтвердили, что архитектура заслуживает внимания. В синтетическом speed-тесте SubQ оказался в 56 раз быстрее моделей, использующих FlashAttention. На LiveCodeBench, где проверяют решение соревновательных задач по программированию, модель набрала 89,7% — это уже не нишевый эксперимент, а результат в диапазоне сильных coding-моделей. Иначе говоря, тезис «быстро, но глупо» пока не подтверждается.

При этом важно не впасть в другую крайность и не объявлять смерть трансформеров по пресс-релизу. Даже сама Subquadratic не говорит, что SubQ заменит лучшие модели во всех сценариях. Скорее речь о другом: в части задач — там, где критичны длинный контекст, скорость и цена, — новая архитектура может быть заметно выгоднее. Это особенно интересно для enterprise-кейсов, где моделью нужно прогонять не один PDF на три страницы, а сотни документов, журналы инцидентов, переписку саппорта, спецификации и целые репозитории. Для разработчиков это означает более реалистичный анализ больших кодовых баз. Для продуктовых команд — шанс удешевить RAG, поиск по знаниям и внутренние copilot-сценарии. Для CIO и CTO — повод еще раз пересчитать, что в AI-бюджете съедают не лицензии, а вычисления.

Скепсис, впрочем, никуда не делся, и это полезно. Инженер Дэн Макатир в X сформулировал реакцию рынка довольно жестко: либо перед нами крупнейший прорыв со времен Transformer, либо история из жанра «слишком красиво, чтобы сразу верить». Такой тон понятен. Компания пока не открыла модель для широкого тестирования, а заявления о стоимости сложнее проверить снаружи, чем скорость на стандартном стенде. CEO Джастин Дэнгел утверждает, что один прогон теста RULER 128 на SubQ обходится компании примерно в $8; сравнение с конкурентами пока остается в первую очередь словами самой Subquadratic, а не общедоступной рыночной метрикой.

И все же даже в осторожном чтении эта история выглядит важной. Последние два года индустрия в основном масштабировала уже знакомую архитектуру: больше параметров, больше GPU, больше дата-центров, больше разговоров про энергоэффективность после очередного счета за электричество. Если Subquadratic действительно нашла рабочий способ строить сильные LLM через разреженное внимание, то спор начнется уже не о том, кто быстрее учит следующий гигантский трансформер, а о том, зачем вообще держаться за прежнюю схему. Проверить исходные цифры и цитаты можно в материале MIT Technology Review.

Поделиться: Telegram X LinkedIn