Статья AWS начинается с садовода
Он сообщил ассистенту, что у него быстро дренирующие грядки, что он использует только органические удобрения и что петунии мучились в жару.
Разбор четырёх кейсов AWS: память ассистента, агентный RAG, голос и ISO 42005. Что решает судьбу ИИ-агента в компании.
AWS за короткий срок выложил четыре разбора агентных систем: персональный ассистент с памятью на AgentCore и OpenClaw, голосовой консьерж для авиакомпании, агентный retrieval на LangChain и Bedrock Knowledge Bases и разбор ISO/IEC 42005:2025.
Во всех четырёх ценность агента задаёт то, что окружает модель.
Модель подключается по API за день, а память, поиск, швы с бэкендами и учёт рисков строятся месяцами.
На этих участках проект даёт результат или тихо закрывается.
Он сообщил ассистенту, что у него быстро дренирующие грядки, что он использует только органические удобрения и что петунии мучились в жару.
Через три недели он спрашивает про полив, а ассистент ничего не помнит.
Каждый диалог начинается с нуля, и контекст пересказывает сам пользователь.
Причина в отсутствии памяти о человеке, а качество ответов тут ни при чём. Механика решения простая.
Слой памяти вытаскивает из диалогов устойчивые факты и предпочтения, хранит их отдельно от истории чата и подмешивает в контекст при следующем запросе. Модель остаётся прежней. Для бизнеса последствия прямые.
Возьмём ассистента менеджера по продажам, который помнит, что клиент уже отказался от одного тарифа и ждёт интеграцию с 1С.
По нашей прикидке, он экономит несколько минут на каждом обращении, и за квартал эти минуты складываются в рабочие недели.
Ассистент без памяти работает как поисковая строка с хорошими манерами.
Есть и обязательство:
Это архитектурное требование, и закладывать его нужно до запуска.
Второй разбор описывает ошибку, которую трудно заметить.
Пользователь просит сравнить два продукта по трём параметрам.
Фактически он задал шесть вопросов: каждый продукт по каждому параметру.
Классический RAG превращает фразу в один вектор, и этот вектор усредняет все намерения.
Поиск отрабатывает без ошибок, оценки релевантности выглядят прилично, ответ получается гладким.
Найденные фрагменты закрывают лишь часть вопроса, и недостающее модель додумывает.
Агентный retrieval решает это декомпозицией.
Агент разбирает вопрос на подзапросы, ищет по каждому отдельно, проверяет, чего не хватает, и только потом собирает ответ. Цена: больше обращений к индексу и выше задержка.
Размен оправдан, если ошибка в сравнении тарифов или спецификаций дороже лишней секунды.
Декомпозиции помогает структура данных.
Если у каталога есть таксономия и фасеты, оси для разреза уже заданы: бренд, тип, характеристики.
Агент режет вопрос по атрибутам, которые бизнес давно описал в PIM, и не гадает.
Наша рабочая гипотеза по проектам с каталогами: при аккуратной модели данных RAG даёт заметно больше, чем при «просто загруженных PDF».
Мы проверяем её на каждом внедрении.
Третий кейс: голосовой консьерж авиакомпании. Пассажир говорит «перенеси меня на место у окна» или «что с задержкой рейса» и не открывает экраны. Со стороны это похоже на задачу для модели речи, но AWS сама перечисляет инженерные задачи. Аудио идёт в обе стороны потоком. Нить разговора держится на многих репликах. Агент ходит в существующие системы без жёсткой связки с ними. Всё это должно выдерживать пиковый трафик перед праздниками.
Голосовой слой тонкий, основная работа лежит в интеграции: статус рейса живёт в одной системе, места в другой, бронирование в третьей. Если агент вызывает их через явный шов, например MCP-сервер или очередь событий вроде Apache Kafka, любую систему можно заменить без переписывания агента. Если агент зашит в чужой API напрямую, первое обновление бэкенда ломает ассистента, и инженеры чинят его ночью. Пассажир видит одну фразу и одно подтверждение.
За ними стоят потоковый транспорт, контроль состояния диалога и аккуратные контракты с бэкендами. Простой результат для пользователя требует сложной инженерии под ним.
Четвёртый текст посвящён ISO/IEC 42005:2025, стандарту оценки воздействия систем ИИ. AWS начинает с цифры: глобальные инвестиции в ИИ в 2025 году составили $581,69 млрд, а внедрение идёт быстрее, чем шло у ПК и интернета.
Отдельно приведена мысль исследователей AI Adoption Initiative о «недостающем звене»: между теми, кто создаёт модели, и теми, кто ими пользуется, стоят посредники.
Они переводят возможности ИИ в практическое развёртывание, а национальные стратегии их часто упускают. Эти посредники и есть интеграторы.
Оценка воздействия на бумаге бесполезна, если у системы нет журнала: кто спросил, какие данные ушли в модель, что она ответила, какой инструмент вызвала.
Практический способ получить такой журнал состоит в том, чтобы пропускать все обращения к моделям через единый шлюз с маскированием персональных данных и аудитом.
Мы строим такие контуры как LLM & Security Gateway, и по нашему опыту проверяющий получает в них готовый источник доказательств.
По четырём разборам AWS агент выходит из статуса игрушки после четырёх инженерных решений.
Он помнит клиента, ищет по всем частям вопроса, подключается к бэкендам через заменяемые швы и оставляет след, который можно предъявить аудитору.
Выбор модели стоит в этом списке последним: её через год заменят, а память, швы и журнал останутся.
Метрика одна: сколько времени проходит от запроса до полезного результата. Ассистент, который заставляет повторять контекст, это время съедает. Агент, сломавшийся при обновлении CRM, обнуляет его. Агент, о котором служба безопасности ничего не знает, вряд ли переживёт масштабирование. Проект, который не двигает метрику, остаётся театром, и закрывают его вместе с теми, кто его запускал.