Документ на 10 тысяч слов может потребовать около 50 млн операций сравнения токенов, и именно поэтому архитектуры LLM уперлись не только в качество, но и в цену. MIT Technology Review пишет, что вокруг этой проблемы уже формируется новая волна AI-стартапов: они пытаются построить языковые модели после эпохи трансформеров, чтобы те были быстрее, экономнее и лучше работали с длинным контекстом.
Повод для разговора понятен. С 2017 года, когда исследователи Google выпустили работу Attention Is All You Need, трансформеры стали базовой машиной почти для всей индустрии генеративного ИИ. Через девять лет это уже не просто удачная архитектура, а фундамент рынка. Но именно здесь и начались проблемы: многие недавние успехи больших моделей, включая reasoning-подходы и расширение контекстного окна, все чаще выглядят не как естественное развитие базовой идеи, а как набор инженерных костылей поверх ее ограничений. Для разработчиков и компаний это важный сигнал: следующий рывок в AI может прийти не от еще одного «больше параметров и больше GPU», а от пересборки самой математики модели.
Главная претензия к трансформерам упирается в механизм dense attention. Он сравнивает каждый токен с каждым, чтобы уловить смысл текста, и делает это очень точно. Но цена точности растет слишком быстро. Чем длиннее вход, тем больше вычислений. Отсюда и прожорливость LLM по энергии и вычислительным ресурсам. В статье приводится еще один маркер масштаба: OpenAI, по словам президента компании Грега Брокмана, может потратить в 2026 году $50 млрд на вычисления, а Международное энергетическое агентство ожидает, что к 2030 году энергопотребление дата-центров удвоится. Для бизнеса это уже не академический спор о красивой архитектуре, а вопрос unit economics: сколько стоит один ответ модели, сколько стоит длинный контекст и можно ли вообще масштабировать AI-агентов без взрывного роста счетов за инфраструктуру.
На этом фоне один из самых очевидных путей выглядит почти банально: если dense attention слишком дорог, надо считать меньше связей. Этим занимается стартап Subquadratic из Майами. Компания утверждает, что смогла построить sparse attention-механику, которая по качеству не проигрывает ведущим массовым LLM хотя бы на части задач, включая поиск и программирование. Заявление сильное, и в самой статье отдельно отмечено, что в индустрии к нему относятся с долей скепсиса. Логика Subquadratic в том, чтобы модель на лету определяла, какие слова в конкретном фрагменте текста действительно важны, а какие можно не учитывать в полном объеме. Если такой подход выдержит независимую проверку, это будет серьезный удар по привычной экономике LLM: меньше вычислений без явного падения качества всегда звучит как лучший сценарий для платформ, которые платят за inference не абстрактными «токенами», а реальными миллионами долларов.
Другой стартап, Manifest AI из Сан-Франциско, пошел еще дальше и предлагает не чинить attention, а заменить его. Их механизм power retention работает не как полное хранение всего контекста, а как «скользящее резюме» того, что важно для задачи прямо сейчас. По мере поступления новых данных менее релевантные части контекста отбрасываются. В отличие от sparse attention, который все еще сохраняет общую картину увиденного текста, power retention пытается держать только полезное рабочее состояние модели. Компания утверждает, что такую схему можно внедрять с минимальным дообучением уже существующих трансформерных моделей. В качестве демонстрации Manifest AI переделала open-source модель StarCoder в вариант PowerCoder, а также выпустила Brumby, который, по ее словам, сопоставим с некоторыми версиями Qwen от Alibaba. Здесь важно не только качество конкретных бенчмарков, но и сам вектор: если подход действительно позволит моделям неделями держать нить задачи или переваривать многочасовые видео без взрывного роста контекста, это заметно меняет рынок агентных систем, корпоративного поиска и AI-автоматизации сложных процессов.
Почему рынок снова смотрит на базовую архитектуру
Третий заметный игрок в материале MIT Technology Review — Liquid AI, спин-офф MIT из Кембриджа, штат Массачусетс. Эта компания не отказывается от трансформеров полностью, а смешивает их с собственной технологией liquid neural networks и называет результат LFM, liquid foundation models. Идея в том, чтобы делать модели меньше, гибче и дешевле в запуске. По словам сооснователя и CEO Рамина Хасани, такие модели уже используются автопроизводителями, включая Mercedes, и могут работать на компактных чипах внутри автомобиля. Более того, последние версии компания запускает даже на Raspberry Pi, то есть на устройстве, которое стоит около $50 и явно не похоже на типичную площадку для современного генеративного ИИ. Это уже важно не только для облачных платформ, но и для edge-сценариев: локальные ассистенты, встраиваемый AI, промышленные устройства, транспорт, робототехника.
У Liquid AI есть еще один аргумент, который хорошо читается рынком: размер модели перестает быть главным символом силы. Компания утверждает, что ее новые модели показывают результат на уровне конкурентов, которые в четыре раза крупнее, включая версии Qwen и Gemma. Внутри эти системы гибридные: примерно 20% трансформеров и 80% liquid neural networks. Такой подход любопытен по двум причинам. Во-первых, он не требует идеологического разрыва с тем, на чем индустрия строилась почти десятилетие. Во-вторых, он показывает, что гонка может пойти не только по линии «полностью новая архитектура», но и по линии аккуратных гибридов, где старые и новые идеи живут вместе. Для CTO и product-команд это, возможно, даже более реалистичный сценарий: не выбрасывать весь стек, а постепенно получать лучший inference, меньшее энергопотребление и больше вариантов развертывания.
Для русскоязычной IT-аудитории здесь практический вывод довольно приземленный. Если архитектуры LLM действительно начнут отходить от классического трансформера, рынок изменится не только на уровне исследовательских статей. Пересоберутся требования к железу, inference-стекам, компиляторам, способам сжатия моделей и к тому, как вообще проектируются агентные системы с длинной памятью. Разработчикам это сулит новые классы open-source моделей и новые компромиссы между качеством, задержкой и ценой. Стартапам и корпорациям это обещает более дешевые AI-функции там, где сегодня экономика не сходится. А инвесторам напоминает неприятную, но полезную вещь: лидерство в AI не гарантируется навсегда, если базовая архитектура начинает тормозить рынок сильнее, чем разгонять его.
Главный вопрос теперь не в том, исчезнут ли трансформеры завтра. Скорее, речь о том, останутся ли они универсальным стандартом для следующих поколений моделей или превратятся в один из компонентов более сложных гибридов. Если текущая волна компаний хотя бы частично подтвердит свои заявления, архитектуры LLM в ближайшие годы могут стать куда разнообразнее, а конкуренция сместится с размера дата-центра на то, кто лучше умеет считать только действительно важное. Подробности разбора собраны в материале .