AWS выкатила кэширование моделей для Amazon SageMaker HyperPod - механизм, который убирает разрыв между «запросили под инференс» и «модель отвечает». Для больших моделей вроде DeepSeek-R1 (600+ ГБ весов) этот разрыв - половина рабочего часа простоя: подробности в блоге AWS.
Главная мысль здесь шире одного релиза: результат от AI решает не выбор модели, а инженерия вокруг неё - то, сколько времени проходит от запуска до первого полезного ответа. Это и есть TTU, time to use, и именно эту метрику бизнес считает деньгами, а не токенами. Перед тем как модель ответит на первый запрос, под капотом происходят два последовательных скачивания: образ инференс-сервера тянется из Amazon ECR, затем веса модели - из S3, FSx for Lustre или HuggingFace Hub.
Для компактной модели это занимает пару минут. Для DeepSeek-R1 или сопоставимого по размеру Llama - от получаса. Всё это время под нагрузку в проде физически не готов ни один под, а трафик клиента либо ждёт, либо падает на резервный узел, который тоже нужно было прогреть заранее.


