AI-агент стоит столько, сколько стоит доведённая до конца задача

Почему цена токена ничего не говорит о стоимости AI-агента: разбор кейсов AWS, Condé Nast с её 250 минутами на поиск и метрики, по которым бизнесу стоит оц

  • Что показала AWS
  • Почему цена токена вводит в заблуждение
  • Сначала замерьте, сколько задача стоит сейчас
  • Где агенты обычно ломаются

Повод

  1. За неделю AWS опубликовала пять разборов про агентов на Bedrock.

  2. Среди них конвейер из трёх агентов, который несколько дней сводит музыкальный трек, поиск по 140 000 видео в Condé Nast и RAG по страховым убыткам.

  3. Самая полезная для бизнеса мысль оказалась в анонсе модели GPT-6.1 Sol: экономику агента считают по всей задаче.

  4. Цена токена - одна строка в этой смете, а бюджет обычно уходит на другие.

Что показала AWS

  1. Темы у разборов разные. Вместе они показывают, как агенты работают в эксплуатации. - Condé Nast.

  2. Редакторы Vogue, GQ, Vanity Fair и Wired тратили в среднем 250 минут на один поиск в архиве из 140 000 видео.

  3. Старый поиск видел только названия и описания и не мог заглянуть внутрь ролика.

  4. Компания построила мультимодальный поиск, который индексирует содержимое видео. - Страховые убытки.

  5. Ответы о выплатах лежат в разных местах: в заметках урегулировщика, сметах ремонта, полицейских протоколах, платёжных реестрах и сканах. AWS собирает их в базу знаний с RAG - генерацией ответа на основе найденных документов. - Музыкальный конвейер.

  6. Один агент генерирует аудио на GPU инстанса, двое других открывают записанный им .wav и дорабатывают его.

  7. Работа идёт несколько дней, а serverless-сессии ограничены несколькими часами, поэтому AWS переносит агентов на выделенные инстансы. - GPT-6.1 Sol. В анонсе прямо сказано: агент собирает данные, вызывает инструменты, пробует подходы, исправляет ошибки и проверяет результат.

  8. Каждый неверный шаг добавляет вызовы модели, задержку и ручную работу.

Почему цена токена вводит в заблуждение

  1. Агент работает циклом: решение, действие, проверка, следующее решение.

  2. Стоимость задачи складывается из числа витков, цены каждого витка, времени ожидания и минут сотрудника, который разбирает неудачи. Пример на условных числах.

  3. Дешёвая модель проходит задачу за 12 шагов и в трети случаев отдаёт её человеку.

  4. Модель вдвое дороже за токен справляется за 5 шагов и отдаёт человеку одну задачу из десяти.

  5. Даже счёт за API у второй модели меньше: 5 шагов по двойной цене дешевле 12 по одинарной.

  6. Если добавить зарплату сотрудника, разница вырастет в разы.

  7. Числа здесь гипотетические, но механика именно такая, и проверить её на своих данных можно за неделю.

  8. Поэтому модели сравнивают по стоимости одной успешно закрытой задачи, а прайс-лист для этого не годится.

Сначала замерьте, сколько задача стоит сейчас

  1. В кейсе Condé Nast самое полезное - цифра «до»: 250 минут на поиск.

  2. Компания знала, сколько стоит задача без AI, и поэтому смогла посчитать эффект.

  3. Большинство пилотов, которые я видел, начинались без такого замера, и через полгода никто не мог сказать, окупились ли они.

  4. Время до пользы (TTU) измеряют в тех единицах, в которых задача болит: в минутах редактора, часах урегулировщика, днях до появления товара на витрине.

  5. Если за квартал агент не сдвинул ни одну из этих цифр, это демонстрация, и финансовый директор рано или поздно так её и назовёт.

Оценить, где ИИ даст эффект в вашем процессе

Где агенты обычно ломаются

  1. В страховом кейсе AWS приводит два запроса.

  2. Клиент спрашивает, одобрен ли его убыток.

  3. Урегулировщику нужны все открытые автоубытки больше $10 000 за прошлый месяц.

  4. Первый запрос - классический RAG: найти документы и пересказать их.

  5. Второй - выборка по полям с фильтрами и суммами, и с ней векторный поиск справляется плохо: он возвращает похожие тексты и не гарантирует полный список. В рабочей схеме инженеры разводят такие запросы: смысловые вопросы идут в RAG, отчётные - структурированным запросом в учётную систему.

  6. Именно здесь демо чаще всего не доходит до прода.

Инфраструктура под длинные задачи

Музыкальный конвейер AWS показывает вторую проблему.

Задача длиной в несколько дней переживает перезапуски, смену сессий и ошибки отдельных агентов.

Контекст модели живёт до конца сессии, поэтому состояние хранят снаружи: в файлах, очередях, базе.

Агенты передают друг другу артефакты

В корпоративной интеграции эту роль давно играет шина. Заказ, остатки и карточка товара проходят через Apache Kafka или Datareon, и при сбое одного участника процесс не теряется.

Агенты работают в тех же условиях, и инженерные решения для них уже есть.

Как мы это собираем в KT.Team

  1. В проектах AI-native интеграции мы начинаем с трёх вещей. Единый шлюз к моделям.

  2. Через LLM & Security Gateway идут вызовы к Claude, OpenAI, GigaChat, YandexGPT и Qwen.

  3. Шлюз помечает каждый вызов идентификатором задачи, поэтому стоимость считается за закрытую задачу.

  4. Он же маскирует персональные данные, а модель можно сменить, не переписывая агентов. Инструменты через MCP.

  5. Агент работает с 1С, PIM на Akeneo или Pimcore и Elasticsearch через MCP-серверы с явными правами. В каждом сервере мы задаём, что агенту можно читать и менять, и записываем каждое его действие в журнал.

  6. Гибридный поиск. RAG мы строим на Elasticsearch: векторный поиск по смыслу работает вместе с точными фильтрами по полям. Запрос «все открытые убытки больше $10 000»

  7. возвращает полный список, а пересказ похожих документов остаётся для смысловых вопросов. В каталожных проектах мы применяем тот же подход к генерации текстов карточек, фасетам и таксономии в PIM. Замеряем две вещи: сколько минут контент-менеджер тратит на карточку до и после внедрения и какая доля карточек проходит модерацию без правок.

Вердикт

Агента оценивают по трём числам: стоимость одной закрытой задачи, доля задач, решённых без человека, и минуты сотрудника до и после внедрения. Если команда не может назвать эти числа, она пока не знает, работает ли её агент. Модели продолжат дешеветь, и компании, которые считают стоимость задачи целиком, увидят эту экономию в отчётности раньше остальных.

Обсудить статью: AI-агент стоит столько, сколько стоит…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: