Накопители NVMe уже демонстрируют ёмкость 256 ТБ, но для дата-центров важнее не рекорд сам по себе. Озёра данных для ИИ перестают быть недорогими складами сырых файлов: обучение, инференс и агентные сценарии требуют читать данные параллельно и почти непрерывно. Для российских команд это означает, что при расчёте AI-инфраструктуры недостаточно купить GPU — надо заранее проверить, успевает ли за ними слой хранения.
Об этом сообщает The New Stack в материале Мринала Кочара, старшего вице-президента по разработке флеш-продуктов SanDisk. Публикация помечена как спонсорская, поэтому её выводы о QLC-флеше разумно читать как позицию производителя, а не как независимый тест. Но описанная проблема знакома любому, кто видел простаивающие ускорители: дорогой вычислительный кластер не делает полезной работы, пока ждёт датасет, эмбеддинги или промежуточные результаты.
Дата-озеро больше не работает в ночную смену
Классическое дата-озеро проектировали для другого ритма. В него недорого складывают текст, изображения, видео, телеметрию и полуструктурированные записи, а затем периодически запускают пакетную аналитику. Такая модель терпима к задержкам: отчёт может формироваться дольше, а доступ к архиву не обязан быть равномерным. Главный ориентир — стоимость хранения терабайта.
AI-нагрузка ломает это допущение. Обучение многократно проходит по большим наборам данных и делает это из распределённого кластера. Инференс тоже не сводится к одному чтению: внешний запрос способен вызвать поиск по векторному индексу, загрузку контекста, обращение к документам, чтение результатов предыдущих шагов и запись новых артефактов. Если поверх этого работает агент, число операций растёт ещё сильнее — и они приходят не по удобному ночному расписанию.
Поэтому озёра данных для ИИ должны одновременно принимать новые данные и обслуживать много конвейеров чтения. Узким местом становятся не только задержка отдельного обращения, но и устойчивая пропускная способность при параллельном доступе. Архитектура, рассчитанная на то, что активна лишь малая часть архива, быстро показывает характер: формально данных хватает, практически GPU ждут I/O.
Почему одной добавкой памяти проблему не закрыть
Логичный первый ответ — добавить вычислителей, DRAM или высокоскоростной памяти рядом с GPU. Однако это дорого не только на закупке. Ускорители потребляют много энергии, требуют охлаждения и занимают стойки; у дата-центра есть пределы по мощности, площади и циклам обновления оборудования. Если наборы данных постоянно растут, переносить всё в самый быстрый и самый дорогой слой хранения становится экономически сомнительным.
Рынок уже умеет разделять хранилище по классам обслуживания: дешёвые ёмкостные и архивные уровни соседствуют с премиальными, где закреплены требования по задержке, IOPS, пропускной способности и доступности. Генеративный ИИ ускоряет этот сдвиг. Всё больше рабочих данных приходится держать на уровне, способном выдержать постоянное параллельное чтение, а не просто надёжно лежать до следующего отчёта.
Автор предлагает смотреть на QLC NAND как на один из способов найти баланс между плотностью, производительностью и энергопотреблением. QLC хранит четыре бита в одной ячейке, поэтому позволяет повышать ёмкость SSD. Чем больше данных помещается в одном устройстве, тем меньше накопителей, стоек и сопутствующей инфраструктуры требуется для того же объёма. В гиперскейле это также влияет на показатель терабайт на ватт — полезную метрику, когда лимит по электричеству важнее свободных юнитов в стойке.
У плотности есть инженерная цена. Большим SSD нужны эффективные фоновые процессы очистки и переразмещения данных: лишние перезаписи тратят энергию, снижают ресурс накопителя и способны просадить производительность. Поэтому при выборе платформы важны не рекламные гигабайты в секунду, а поведение под длительной смешанной нагрузкой, write amplification, восстановление после сбоев и наблюдаемость. Для команды эксплуатации это ещё один повод тестировать реальный профиль RAG, дообучения или инференса, а не синтетический бенчмарк из презентации поставщика.
Следующий вопрос для архитекторов — где провести границу между «горячим» слоем рядом с вычислениями, ёмкостным флешем и более дешёвым архивом. По мере роста моделей и агентных систем озёра данных для ИИ будут всё чаще проектировать как активную часть вычислительного контура. Победит не тот, кто поставит максимум GPU или максимум терабайт, а тот, кто сумеет не превратить соединение между ними в самую дорогую очередь в дата-центре.