Инфраструктура для AI-агентов: конец старого DevOps

Modal подняла $355 млн и переизобрела инфраструктуру под AI-агентов: снапшоты GPU, мультиоблако, секунды вместо минут. Разбор, что это значит для бизнеса.

  • Почему старый DevOps не тянет агентов
  • Agent experience - другой контракт с железом
  • Механика: снапшоты GPU и мультиоблако
  • Что это значит для бизнеса

Повод

Modal - инфраструктурная компания для запуска AI-моделей - подняла $355 млн в раунде Series C и переориентировала архитектуру на agent experience: контракт с железом под процессы, которые живут секунды. CTO компании Акшат Бубна описывает перестройку конкретно: эластичный inference, снапшоты GPU-состояния, изолированные песочницы для каждого запуска, работа сразу на 17 облачных провайдерах. Агент - короткий процесс: рождается, отрабатывает секунды, умирает тысячами копий в час.

Почему старый DevOps не тянет агентов

  1. Вся современная облачная инфраструктура спроектирована под человека: одна долгоживущая сессия, предсказуемая нагрузка, минуты ожидания в CI или при деплое - терпимая цена.

  2. Агентные workload устроены иначе: тысячи коротких изолированных запусков в час, каждому нужна чистая среда, GPU часто требуется на несколько секунд и тут же освобождается.

  3. Классическая виртуалка стартует минуту, контейнер - десятки секунд, очередь на GPU в облаке добавляет ещё столько же. Компания, которая ставит агентный продукт на такую инфраструктуру, выбирает между двумя проигрышами: держать разогретый пул ресурсов простаивающим и переплачивать, или терпеть холодный старт в несколько минут на каждый вызов агента.

  4. Во втором случае TTU - время до результата - считается временем ожидания инфраструктуры: секунды модели тонут в минутах холодного старта.

Agent experience - другой контракт с железом

Agent experience у Modal означает: масштабирование до нуля и обратно без задержки, изолированная песочница под каждую задачу, доступ к GPU за секунды. Проверяет это нагрузочный тест: выдержит ли платформа миллион коротких вызовов агента в день без деградации по стоимости и по времени отклика.

Оценить, где ИИ даст эффект в вашем процессе

Механика: снапшоты GPU и мультиоблако

Основной приём - GPU snapshotting: состояние уже прогретого процесса, загруженные веса модели, инициализированный CUDA-контекст замораживаются и восстанавливаются за секунды вместо повторной инициализации GPU и полной перезагрузки весов, которая может занимать больше минуты.

Это и есть инженерная работа за словом «простой быстрый агент»

- снаружи вызов выглядит мгновенным, внутри стоит сложный механизм восстановления состояния. Мультиоблако на 17 провайдерах решает вторую часть проблемы: burst-нагрузка агентов получает GPU там, где он свободен именно в эту секунду, без упора в квоту одного облака. Песочницы изолируют каждый запуск агента физически - если агент выполняет код или трогает внешние системы, побочный эффект одного запуска не протекает в следующий.

Что это значит для бизнеса

  1. По мере того как модели становятся умнее, харнесс вокруг них - оркестрация вызовов, память, контроль действий - смещает роль человека от построчного контроля модели к управлению вниманием: решать, где нужен человеческий обзор.

  2. Инфраструктура и оркестрация под этим харнессом становятся только важнее: чем автономнее агент, тем выше цена секунды простоя и тем дороже плохо спроектированный слой между агентом и реальными действиями в системах компании.

  3. Для компании, которая оценивает агентный проект, правильный вопрос не «какая модель», а какой профиль задержки и стоимости получится под всплесковой конкурентной нагрузкой агентов и кто отвечает за инфраструктуру, когда она ломается.

  4. Мозг агента почти всегда выносится наружу - в API Claude, GPT, Gemini, YandexGPT или GigaChat. А вот подключение этого мозга к реальным действиям приложения - через MCP-серверы, LLM & Security Gateway, маршрутизацию между моделями и безопасный доступ к боевым данным - это многонедельная инженерная работа, которую компании стабильно недооценивают на старте.

  5. Именно на этом стыке - интеграции агента с реальной системой, а не выбора модели - KT.Team закрывает проекты: AI-native интеграция поверх существующего 1С, Pimcore или Bitrix требует ровно той же дисциплины, что и снапшоты GPU у Modal - незаметной снаружи, тяжёлой изнутри.

Вывод

$355 млн на то, чтобы GPU просыпался за секунду, а не за минуту, звучит скромно, пока не умножить эту секунду на миллионы агентных вызовов в день. Компания, которая не решает этот вопрос инженерно, решает его количеством оплаченных и простаивающих GPU.

Обсудить статью: Инфраструктура для AI-агентов: конец…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: