AI И НЕЙРОСЕТИ

Стартап Subquadratic замахнулся на жизнь после attention

Окно контекста в 12 млн токенов стало главным аргументом стартапа Subquadratic, который предлагает смотреть дальше sparse attention.

✍️ Редакция iTech News | 03.07.2026 | ⏱ 4 мин | Источник: The New Stack
🔮

Стартап Subquadratic вышел с амбициозным тезисом: даже sparse attention для больших языковых моделей может оказаться лишь промежуточной остановкой. Главный аргумент звучит не в стиле презентаций для инвесторов, а вполне инженерно: на старте компания уже собрала модель со sparse attention, способную работать с окном контекста в 12 миллионов токенов. Для русскоязычной IT-аудитории это важный сигнал: гонка за длинный контекст выходит за пределы простого наращивания GPU и все больше упирается в архитектуру.

О проекте Subquadratic, который запустился в 2026 году, сообщает The New Stack. Из самого названия компании читается ее ставка: уйти от квадратичной цены классического attention, где вычислительная сложность растет слишком быстро вместе с длиной входной последовательности. На практике это тот самый потолок, о который регулярно бьются команды, пытающиеся прокормить модели длинными кодовыми базами, журналами событий, юридическими документами или многошаговыми агентными сценариями. Пока рынок спорит о том, достаточно ли оптимизировать трансформеры, Subquadratic предлагает более жесткую формулировку: следующий заметный выигрыш в AI-инфраструктуре может прийти не от очередного патча к attention, а от архитектур, которые научатся обходиться с памятью и зависимостями иначе.

Почему это вообще больная тема, объяснять разработчикам уже не нужно. Классический attention хорош тем, что позволяет модели смотреть на весь контекст, но счет за эту роскошь быстро становится неприятным. Чем длиннее вход, тем хуже ведут себя задержка, потребление памяти и стоимость инференса. Именно поэтому последние два года индустрия живет в режиме бесконечной инженерной оптимизации: flash-реализации, разреженные схемы, линейные варианты, гибриды с внешней памятью, state space models, Mamba-подобные подходы и все, что обещает держать качество без катастрофы по ресурсам. На этом фоне окно в 12 миллионов токенов звучит не как красивый маркетинговый баннер, а как попытка показать: да, проблему длинного контекста еще можно толкнуть дальше, если не бояться ломать привычную механику.

У Subquadratic здесь интересная позиция. Компания не просто продает идею длинного контекста, а заходит с более неудобным вопросом: что будет после attention как доминирующего механизма? Это уже не спор о том, можно ли ускорить трансформер еще на несколько десятков процентов. Это спор о том, не уперлась ли отрасль в архитектурный налог, который становится слишком дорогим по мере роста запросов к моделям. Если задача модели состоит не в генерации пары абзацев, а в обработке многомиллионного контекста с приемлемой стоимостью и задержкой, инженерная логика начинает работать против ортодоксии: возможно, чинить attention до бесконечности просто менее выгодно, чем строить следующий базовый примитив.

Для бизнеса и продуктовых команд это меняет акценты довольно быстро. До сих пор длинный контекст часто продавали как удобную пользовательскую фичу: загрузил побольше документов, получил ответ без RAG-обвязки, уменьшил число промптов, сократил дробление данных. Но на уровне production-систем длинный контекст почти всегда превращается в вопрос экономики. Сколько стоит один запрос? Как растет задержка? На каких картах это вообще можно держать? Насколько предсказуемо ведет себя качество, когда модель получает не 128 тысяч токенов, а на порядок больше? Если архитектуры вроде той, на которую намекает Subquadratic, действительно смогут удерживать качество и одновременно снижать вычислительный налог, это ударит сразу по нескольким сегментам: корпоративным copilots, инструментам для анализа кода, AI-поиску по внутренним базам знаний и агентным системам, которые должны помнить длинную цепочку действий, а не жить в коротком окне внимания.

Для разработчиков здесь тоже есть вполне прикладной вывод, без футуристической пены. Вся экосистема вокруг LLM уже привыкла мыслить категориями «влезает в контекст» и «не влезает в контекст». Но если на сцену выходят архитектуры, которые иначе работают с зависимостями в последовательности, начнут меняться и практики разработки. Под вопросом окажутся многие привычные компромиссы: агрессивное чанкирование, сложные эвристики для отбора фрагментов, каскады RAG поверх RAG и попытки экономить каждый токен, как будто на дворе снова лимит в 4K. Это не значит, что retrieval исчезнет или что любой репозиторий можно будет просто целиком скормить модели. Значит другое: у инженерных команд появляется шанс пересобрать стек так, чтобы меньше времени уходило на обход ограничений самой модели.

При этом трезвость здесь важнее восторга. Сам факт работы с 12 миллионами токенов еще не доказывает, что новая архитектура автоматически победит по качеству, цене и устойчивости в реальных нагрузках. Длинный контекст давно умеет впечатлять на демо, но гораздо хуже переносит встречу с production: от деградации поиска нужного фрагмента в огромной последовательности до банального роста общей стоимости владения. Поэтому главный смысл новости не в том, что кто-то объявил конец attention. Смысл в другом: в 2026 году сам вопрос «что после attention?» перестает звучать как академическое упражнение. Если даже молодые компании начинают строить продуктовую историю вокруг пост-attention архитектур, значит рынок уже готов обсуждать не только ускорение трансформеров, но и смену базовой модели вычислений для LLM.

И вот это, пожалуй, самый интересный поворот. Еще недавно длинный контекст был соревнованием на тему, кто вытянет больше токенов внутри знакомой архитектуры. Теперь интрига меняется: кто первым докажет, что следующая волна моделей будет не просто длиннее, а устроена иначе. Для разработчиков, которые устали платить квадратичный налог за каждую новую единицу контекста, это уже не теория, а вполне рабочий запрос к рынку.

Поделиться: Telegram X LinkedIn