Пример из другого сегмента показывает вторую половину задачи.
Простаивающий GPU - скрытый налог на ИИ-бюджет
-
AWS выпустила надстройку Inference Gateway для Kubernetes-кластеров SageMaker HyperPod: без единой правки в коде приложений она режет задержку первого токена LLM-ответа до 82%.
-
Повод локальный - релиз одного облачного вендора, - но цифра обнажает вещь, которую редко считают: большая часть денег, потраченных на GPU для ИИ, уходит не на вычисления, а на простой дорогого железа в очереди.
-
Кластер GPU для LLM стоит десятки тысяч долларов в месяц, и почти вся сумма списывается по часам аренды, а не по числу обработанных токенов.
-
Стандартный Kubernetes-балансировщик распределяет запросы round-robin или по числу открытых соединений - метрикам, которые ничего не знают о состоянии самой модели.
-
Он не видит, у какого пода забит KV-кеш, какой под ещё дожёвывает long-context генерацию на десятки тысяч токенов, а у какого уже загружен в память нужный LoRA-адаптер.
-
Запрос улетает на занятый под и встаёт в очередь внутри GPU, пока счётчик аренды тикает на простаивающем соседнем.