AWS в мае попросила инженеров умерить аппетит к EC2 и сократить «пустую» загрузку инстансов: по словам сотрудников, ожидание нужных машин растянулось с часов до дней. Это не внутренняя скука про FinOps, а симптом более широкого сдвига: спрос на CPU в эпоху ИИ-агентов растет настолько быстро, что его уже чувствуют даже команды внутри одного из крупнейших облаков. Для русскоязычных разработчиков и IT-руководителей сигнал простой: дешевых запасов вычислений становится меньше, а привычка «поднимем еще пару виртуалок» начинает стоить дороже.
Как пишет Tom's Hardware со ссылкой на The Information, в мае AWS собрала инженеров и попросила их снизить «растрату CPU» при работе с EC2. Речь не о том, что компания внезапно разлюбила внутренние эксперименты: смысл в том, чтобы у внешних клиентов оставалось достаточно мощностей. Один из инженеров рассказал, что теперь новые инстансы приходится ждать днями, хотя раньше речь шла о часах. Для команды, привыкшей запускать среду разработки по требованию, это неприятная перемена; для рынка облаков это уже маркер дефицита, а не обычной дисциплины расходов.
Проблема особенно чувствительна именно для EC2, потому что эти инстансы стали базовым слоем значительной части интернета. Внутри Amazon разработчики годами пользовались тем же преимуществом, что и тысячи клиентов AWS: многие веб-сервисы и внутренние инструменты держат низкую среднюю загрузку процессора, поэтому виртуальные машины можно было масштабировать довольно свободно. Если теперь даже внутри компании начались очереди, значит, резерв, на который все рассчитывали, заметно похудел. И это уже не история про несколько забытых тестовых стендов, которые кто-то не выключил перед выходными.
Почему внезапно всем понадобились CPU
Главный фон здесь — агентный ИИ. В дата-центрах долго доминировала логика, при которой CPU были скорее обслуживающим персоналом для GPU: держали сеть, память, оркестрацию и просто «подносили патроны» ускорителям. По данным из материала, привычное соотношение GPU к CPU в AI-конфигурациях, которое раньше могло быть 8:1 или 4:1, сдвигается почти к паритету. Проще говоря, на один только GPU-бюджет уже не уедешь: спрос на CPU растет вместе с числом систем, где модель не просто отвечает на запрос, а вызывает инструменты, ходит в базы, выполняет код и координирует цепочки действий.
Для ИИ-агента CPU — не декоративная деталь, а рабочая лошадь. Именно на процессорной стороне живут tool calls, прокладка между сервисами, управление очередями, часть проверок, часть логики безопасности и весь тот «клей», без которого красивая демонстрация превращается в зависший workflow. Amazon уже сталкивалась с тем, как AI-нагрузка раздувает сметы: месяцем ранее, по данным источника, один внутренний кодовый агент успел сжечь 1,8 млн долларов на токенах и выйти за рамки бюджета на 860%. Это не прямое доказательство CPU-дефицита, но хороший индикатор того, насколько плохо старые лимиты переживают новый режим разработки.
На этом фоне не удивляет, что производители процессоров перестали вести себя как поставщики «второго номера». Tom's Hardware напоминает: AMD недавно представила серверные Zen 6 Venice и сделала это раньше клиентской линейки — для компании такой порядок релизов еще недавно выглядел бы почти ересью. Nvidia тоже сдвигает акцент с одних только ускорителей и продвигает Vera CPU как часть будущей AI-инфраструктуры. Intel, AMD и другие игроки в последние месяцы говорят примерно одно и то же: спрос настолько высок, что рынок готов брать почти любые доступные объемы. Даже AWS, у которой есть собственный Arm-процессор Graviton5 наряду с предложениями на AMD и Intel, не выглядит защищенной от этого тренда.
Что это меняет для команд
При этом сама AWS не согласна с драматичным прочтением истории. После публикации компания заявила, что высокий спрос на EC2 действительно есть, но подавляющее большинство внутренних и внешних потребностей она продолжает закрывать. Представитель AWS настаивает, что никакой новой чрезвычайной директивы нет: компания давно возвращает простаивающие инстансы, подбирает размер машин под реальную нагрузку и масштабирует ресурсы вверх и вниз по потребности. Отдельно Amazon оспорила трактовку, будто инженерам выдали специальные дедлайны на сокращение потребления. Иными словами, публичная позиция звучит так: это не кризис, а обычная для AWS бережливость, просто теперь ее заметили все.
Есть и важная деталь, которая немного остужает панику. По данным The Information, дефицит в первую очередь бьет по spot-инстансам, а не по законтрактованным мощностям. Для бизнеса это существенное различие. Если компания сидит на долгих резервированиях, committed use или иных предсказуемых схемах закупки, она, вероятно, почувствует проблему позже и мягче. А вот команды, которые привыкли строить дешевые экспериментальные среды на споте, могут обнаружить, что эпоха «почти бесплатного» CPU заканчивается. Для стартапов и продуктовых команд это плохая новость: стоимость быстрого прототипирования растет не только из-за GPU и токенов, но и из-за банальной процессорной емкости.
Для русскоязычных разработчиков и CTO практический вывод довольно приземленный. Если сервисы завязаны на агентные сценарии, пора пересматривать архитектурные допущения: считать не только GPU-время и расходы на модели, но и фоновую процессорную часть, которую раньше часто прятали в общий счет облака. Второй вывод еще неприятнее: привычка держать десятки слабо загруженных машин «на всякий случай» становится роскошью. Там, где можно, придется строже чистить idle-инстансы, сильнее думать о right-sizing, внимательнее смотреть на Arm-варианты вроде Graviton и заранее планировать резерв мощности под пики. Спрос на CPU превращается из скучной инфраструктурной темы в вопрос скорости разработки и маржинальности.
Самый интересный вопрос теперь не в том, есть ли дефицит прямо сейчас, а в том, где именно лопнет следующее бутылочное горлышко AI-стека. Пару лет рынок жил в логике «главное достать GPU», но агентные системы возвращают CPU в центр разговора и делают этот слой внезапно дорогим. Если даже внутри AWS пришлось напоминать инженерам, что бесхозные EC2 больше не бесплатный фон, отрасли пора привыкать к новой норме: борьба за вычисления будет идти не только за самые громкие ускорители, но и за те процессоры, на которых держится вся проза агентного ИИ.