Агенты в проде: модель дешевле, чем контур контроля вокруг неё

Claude в GovCloud, MCP-промоушен агентов, оценка мультиагентных систем: что AWS показал о реальной цене ИИ в production.

  • Повод: пять материалов AWS за неделю
  • Что произошло
  • Где компании теряют результат
  • Перенос: ручная работа с ошибками

Повод: пять материалов AWS за неделю

За одну неделю AWS опубликовал пять материалов об эксплуатации ИИ-агентов. Claude Opus 5.5 и Sonnet 5.5 стали доступны в регионах AWS GovCloud (US) для задач с регуляторными требованиями, включая ITAR. Amazon Quick получил автоматизированный перенос агентов между аккаунтами. Для мультиагентных систем появилась оценка объяснимости. По опыту наших проектов, выбор модели занимает около дня, а построение контура контроля вокруг неё занимает квартал, и от этого контура зависит результат. Эту мысль мы и разбираем.

Что произошло

AWS разобрал пять сценариев: - Claude Code на Amazon Bedrock в GovCloud: ИИ-разработка для организаций с экспортным и регуляторным контролем. -

Навык `aws-ai-ml` в Agent Toolkit for AWS.

Он даёт кодовым агентам (Kiro, Claude Code, Codex) знания об оптимизации инференса в SageMaker: агент гоняет бенчмарки эндпойнтов, сравнивает прогоны и генерирует код на SageMaker Python SDK v3. -

Идемпотентный MCP-сервер на Bedrock AgentCore, который переносит агентов, коннекторы, базы знаний и потоки Amazon Quick из dev-аккаунта в production. -

Оценка мультиагентных систем по полезности и объяснимости

- GLM 5.3 от Z.ai: mixture-of-experts модель на 753 млрд параметров для кодинга и долгих агентных задач.

Она доступна на Bedrock без собственной инфраструктуры инференса.

Мы читаем эти новости как одну тему: AWS описывает, как эксплуатировать агентов, и выпускает для этого инструменты наравне с моделями.

Где компании теряют результат

Типичный сценарий выглядит так

Команда за две недели собирает агента, на демо он отвечает хорошо, руководитель одобряет запуск. Затем выясняется три вещи.

Агента нельзя перенести в продуктивный контур без ручной пересборки.

Никто не может объяснить, почему он принял конкретное решение.

Служба безопасности запрещает пропускать данные клиентов через внешний API.

Бюджет потрачен, метрика осталась на месте, проект получает ярлык «эксперимент», а руководитель, который его одобрил, отвечает за потерянные деньги.

Материалы AWS закрывают эти три дыры: перенос между средами, проверяемое качество и допустимый периметр данных.

Перенос: ручная работа с ошибками

  1. AWS прямо называет перенос ресурсов Amazon Quick из разработки в production ручным и подверженным ошибкам занятием.

  2. Агент состоит из нескольких частей: сам агент, коннекторы действий, база знаний, потоки, пространства.

  3. Если часть перенесена, а часть нет, в проде окажется агент, который вызывает несуществующий коннектор. Решение построено на MCP-сервере.

  4. Идемпотентность означает, что повторный запуск даёт то же состояние без дублей.

  5. Аудит означает, что для каждого переноса остаётся запись о том, кто, что и когда выкатил.

  6. Инженеры давно применяют эту дисциплину к релизам, и теперь она распространена на новый тип артефактов.

  7. Протокол MCP служит стандартным швом между агентом и системами компании: через него агент ходит в ERP, PIM или CRM, и через него же администратор управляет жизненным циклом самого агента.

Оценить, где ИИ даст эффект в вашем процессе

Оценка: как доказать, что агент полезен

  1. Мультиагентные системы координируют несколько специализированных агентов и принимают решения в цепочке: планирование поставок, финансовый анализ, обслуживание клиентов.

  2. Ошибка первого агента передаётся второму, и итоговый ответ выглядит убедительно, даже когда цепочка сломалась в середине.

  3. Поэтому AWS предлагает оценивать два параметра: полезность результата и объяснимость пути к нему.

  4. Практический вывод для компании: если вы не можете восстановить, какой агент что решил и на каких данных, вы не можете улучшить систему и не можете отвечать за неё перед регулятором и клиентом.

  5. Метрика качества должна существовать до запуска.

  6. Без неё после запуска нечем подтвердить ни успех, ни провал.

Периметр: регулируемые данные и выбор модели

Доступность Claude в GovCloud показывает, как изменился вопрос в регулируемых отраслях.

Раньше компании спрашивали, можно ли использовать ИИ.

Теперь они спрашивают, в каком периметре

AWS сопровождает публикацию оговоркой: подход подходит не каждой организации, и его нужно сверять с собственными требованиями комплаенса.

Читать эту оговорку стоит буквально

GLM 5.3 на Bedrock добавляет второй аспект: открытую модель теперь можно получать как управляемый сервис.

Одну задачу можно решать несколькими моделями с разной ценой и разной юрисдикцией.

Для этого нужен единый слой, через который идёт трафик к моделям: политики доступа, маскирование данных, журнал запросов и маршрутизация. В нашей практике этот слой называется LLM & Security Gateway.

Он позволяет сменить модель без переписывания приложений.

Скорость разработки: навык вместо промпта

Навык `aws-ai-ml` показывает, как меняется работа инженера

Агент получает специализированные знания предметной области, сам прогоняет бенчмарки, сравнивает конфигурации и выдаёт исполняемый код. Это принцип AI-native разработки: мы измеряем ценность временем от задачи до работающего результата (TTU).

Объём сгенерированного кода для этой оценки ничего не говорит. Операция «подобрать конфигурацию инференса»

выглядит простой, но требует знаний, которые раньше хранили один-два специалиста. Теперь эти знания можно упаковать и воспроизвести.

Что проверить перед запуском

Перед запуском агента в production стоит получить ответы на четыре вопроса: - Воспроизводимость переноса.

Можно ли выкатить агента в прод одной идемпотентной операцией с журналом? - Метрика качества.

Назначен ли до запуска измеримый критерий полезности и объяснимости? - Периметр данных.

Какие данные уходят к модели, где она работает и кто это видит? - Замена модели.

Сколько усилий займёт переход на другую модель, если изменятся цена или условия?

Если хотя бы на один вопрос нет ответа, у компании демо, и до системы ему далеко.

Вывод

Пять публикаций AWS читаются как руководство по эксплуатации агентов.

Модель занимает в нём одну строку, остальное описывает релизы, аудит, оценку и периметр.

Эти элементы отделяют ИИ, который двигает метрику, от ИИ, который хорошо смотрится на презентации.

Бизнес платит за результат, а результат обеспечивает контур вокруг модели.

Инженеры строят его заранее, до первого запуска.

Обсудить статью: Агенты в проде: модель дешевле, чем…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: