Проект Headroom, который внутри Netflix уже используют несколько команд, по оценке автора помог сэкономить около $700 тысяч и высвободить 200 млрд токенов для других задач. Для рынка, где компании сначала раздают разработчикам доступ к ИИ-инструментам, а потом хватаются за калькулятор, это не просто занятный open source-релиз, а очень практичная история про сжатие токенов и контроль расходов.
Инженер Netflix Теджас Чопра выложил Headroom в open source в январе 2026 года, и с тех пор проект успел набрать около 2 тысяч звезд на GitHub и более 120 форков, сообщает The Register. Формально это не официальный продукт Netflix, но внутри компании его уже применяют несколько команд, а снаружи на него опираются и сторонние проекты. Сам Чопра представил систему на Open Source Summit и описал ее довольно приземленно: многие пользователи приходят не за красотой архитектуры, а потому что их уже успели неприятно удивить счета за токены.
Повод у него был личный и понятный любому разработчику, который хотя бы раз увлекся «поболтаю с моделью еще пять минут». По словам Чопры, идея родилась после домашнего счета на $287 за работу с Claude Sonnet: немного отладки, немного рефакторинга, запросы к базе через MCP-инструменты, ничего космического. На бумаге тариф выглядел терпимо: $3 за миллион входных токенов, а при выходе за окно контекста в 200 тысяч токенов уже $6 за миллион. Но когда в промпт вместе с полезными данными заезжают громоздкие JSON-схемы, повторяющиеся поля из базы, вложенные шаблоны API-ответов и прочий машинный балласт, сумма начинает расти быстрее, чем хотелось бы. В этом месте сжатие токенов из красивой инженерной идеи превращается в способ не сжечь бюджет на сопровождение агента.
Логика Headroom строится на довольно трезвом наблюдении: значительная часть того, что отправляется в окно контекста LLM, вообще не предназначена для чтения «по-человечески» и потому хорошо поддается упаковке. Чопра оценивает долю избыточных токенов примерно до 90 процентов в зависимости от типа данных. Лучше всего режутся серверные логи, где, по его словам, можно выбросить до 90 процентов шума, выводы MCP-инструментов с их многословным JSON, результаты запросов к базам со стабильной схемой и деревья файлов с повторяющимися метаданными. Сам код и ручные инструкции пользователя Headroom тоже сжимает, но аккуратнее: задача не в том, чтобы сделать промпт короче любой ценой, а в том, чтобы убрать именно повтор и технический мусор.
Где именно экономятся деньги
Технически Headroom работает как локальный прокси на машине разработчика, на порту 8787. Пользователь оборачивает свой CLI-клиент для LLM командой вроде headroom wrap codex, после чего весь входящий контекст проходит через несколько этапов обработки. Первый называется CacheAligner: он пытается понять, что именно изменилось по сравнению с уже отправленными данными, и передает модели только новые фрагменты вместо полной пересборки почти неизменного промпта. Это важно из-за кешей у самих провайдеров моделей. Если в системном промпте у вас каждый раз меняется, например, дата или UUID сессии, вы фактически сами себе создаете cache miss и платите заново за то, что по смыслу не изменилось.
Дальше включается маршрутизатор, который определяет тип контента и отправляет его в профильный компрессор. Для кода используется AST-компрессор, для JSON и DOM-структур свои обработчики, а для текста и JSON еще есть так называемые squasher-модули. Они статистически оценивают, какие куски действительно нужны модели, а какие можно свернуть без потери смысла. Важная деталь, которой Чопра явно гордится: сжатие здесь обратимое. На финальном этапе, который называется Compress Cache and Retrieve, Headroom ставит маркеры на местах сжатых фрагментов, а если модели вдруг нужен исходный контекст, она может запросить его обратно через MCP с машины пользователя. Оригиналы при этом хранятся в Redis или SQLite. Иными словами, это не безвозвратная стрижка под машинку, а скорее аккуратный архив с быстрым доступом к полной версии.
На этом фоне особенно любопытно смотрится сравнение с нативными механизмами экономии у самих вендоров моделей. Чопра напомнил, что у Claude, например, prefix cache по умолчанию живет всего пять минут. Если за это время в сессии нет активности, окно контекста приходится прогружать заново, даже если данные те же самые. В документации API есть и TTL на час, но там своя математика: чтобы получить 90 процентов экономии на чтениях, нужно заплатить двойную цену за записи. То есть инструменты у провайдеров есть, но «сладкое место» между стоимостью, задержкой и качеством разработчик все равно подбирает сам. Отсюда и спрос на внешние решения: от коммерческих сервисов вроде Token Company до open source-проектов RTK и LeanCTX. Headroom здесь пытается занять нишу инструмента, который встроен прямо в рабочий процесс разработчика и не выносит контекст наружу больше, чем нужно.
Почему это важно не только для бухгалтерии
История Headroom попала в нерв момента еще и потому, что рынок наконец перестает делать вид, будто большой контекст сам по себе означает лучший результат. Окна в топовых моделях уже растут в сторону 2 млн токенов, но щедрый лимит не означает, что модель одинаково хорошо переварит весь этот поток. В статье приводятся и исследовательские аргументы. В 2025 году одна группа исследователей оценила, что чтение пользовательского ввода съедает около 76 процентов всех токенов. Отдельно упоминаются работы, где LLM хуже ориентируются в длинном контексте: исследователи из Стэнфорда показали склонность моделей лучше замечать начало и конец окна, а середину пропускать, а команда Chroma описала явление context rot, когда по мере роста длины входа надежность ответов становится все более неровной. В такой картине мира сжатие токенов полезно не только для финансового директора, но и для качества самих ответов.
Есть и еще один прагматичный слой: задержка. Чопра рассказал про пользователя, который форкнул Headroom для голосового приложения. В интерфейсах такого типа даже паузы и тишина конвертируются в токены, а человеческое ухо довольно жестко относится к задержкам. Если отклик выходит за пределы примерно 200 миллисекунд, разговор начинает звучать неестественно. Поэтому борьба за меньшее окно контекста здесь одновременно означает и меньший счет, и более живой продукт. Для стартапов с голосовыми агентами, внутренних copilot-инструментов и команд, которые гоняют в LLM логи, документацию и результаты работы агентов, это уже не «оптимизация на потом», а вполне базовая дисциплина эксплуатации.
Сам Чопра не делает вид, что проект уже отполирован до блеска. Headroom пока находится на версии 0.22, и в списке задач у него есть как минимум более строгая проверка точности компрессии и новые специализированные обработчики, например для финансовых данных. Отдельно он упоминает, что аудио, изображения и видео еще предстоит разбирать всерьез, хотя один из пользователей уже сделал форк для парсинга видео. Параллельно готовится связанный open source-проект Headlight, который должен отслеживать происхождение каждого токена и, вероятно, будет полезен для многошаговых и мультимодельных пайплайнов. На этом фоне главный вопрос для индустрии звучит просто: если расходы на ИИ все чаще упираются не в цену модели как таковой, а в объем бессмысленно протащенного контекста, не станет ли сжатие токенов такой же обязательной инженерной практикой, как кеширование, профилирование и контроль SQL-запросов? Подробности исходной истории можно проверить в .