AI-ассистент на совещании правления: где он ломается и как это чинить

AWS за неделю выпустил 5 разборов, и 4 из них про обвязку модели. Разбираем 4 сбоя AI-ассистента на совещании и 4 слоя проверки, которые их закрывают.

  • Пять статей об одном
  • Четыре способа опозориться перед правлением
  • Как устроен контур проверки
  • Что это значит для компании без GPU-кластера

Повод

  1. За одну неделю в блоге AWS о машинном обучении вышли пять технических разборов.

  2. Четыре из них посвящены обвязке вокруг модели: восстановлению кластера после сбоя, пропускной способности сети, хранению данных в другом регионе и проверке ответов.

  3. Для бизнеса полезнее всего кейс NarrateAI.

  4. Это AI-ассистент, который отвечает руководителям на вопросы по данным прямо во время бизнес-ревью.

  5. Его авторы пишут прямо: если неверная цифра на экране бьёт по чьей-то репутации, одной сильной модели мало. Отсюда правило для директора.

  6. Бюджет AI-проекта делится между моделью и контуром проверки.

  7. По нашему опыту, контур забирает большую часть денег и времени.

Пять статей об одном

Инженеры AWS опубликовали: - SkyRL на SageMaker HyperPod. RL-дообучение агентов. В обучении с подкреплением (RL) модель выполняет цепочку шагов, получает оценку-награду за результат и корректирует поведение.

Один прогон съедает сотни GPU-часов, поэтому кластер должен пережить отказ железа без потери прогресса. - MoE-модели на Amazon EKS с EFA и DeepEP.

Пропускная способность выросла на 40%

MoE (Mixture-of-Experts) - модель из множества «экспертов», на каждый токен работает только часть из них.

Эксперты разнесены по разным GPU, и узким местом становится обмен данными между сотнями ускорителей.

Инженеры получили 40% за счёт сети, модель осталась прежней. - HyperPod и Qumulo.

Вычисления идут в одном регионе AWS, данные лежат в другом.

Команда не копирует петабайты и не платит задержкой за каждое чтение. - Qwen3-TTS на SageMaker.

Модель на 1,7 млрд параметров повторяет голос человека по короткой записи без дообучения. - NarrateAI на Amazon Bedrock.

Контроль качества ответов LLM для руководства. У AWS нет дефицита моделей и GPU.

Их инженеры всё равно пишут о надёжности, сети и проверке.

Мы видим то же в своих проектах: ломаются они именно в этих местах.

Четыре способа опозориться перед правлением

  1. Авторы NarrateAI называют четыре сбоя, которые проявляются только в продакшене. Выдуманная метрика. Модель пишет «маржа выросла на 3 пункта»

  2. , хотя в данных такой цифры нет. Фраза звучит правдоподобно, и на совещании её никто не перепроверяет.

  3. Ошибку находят через месяц, когда цифра уже легла в решение о бюджете. Лимиты API (throttling).

  4. Провайдер модели ограничивает число запросов в минуту.

  5. Десять участников спрашивают одновременно, и ассистент замолкает в самый нужный момент. Задержка проверки.

  6. Каждый слой контроля добавляет секунды.

  7. На совещании пауза в ответе заметна всем, и ассистента перестают спрашивать. Оценочный язык. «Значительный рост», «слабый квартал».

  8. Модель выносит оценку, которую у неё не просили, а отвечает за формулировку руководитель.

Оценить, где ИИ даст эффект в вашем процессе

Как устроен контур проверки

  1. Мы строим такие системы из четырёх слоёв, по одному на каждый сбой. ### Цифры считает код

  2. Модель переводит вопрос в запрос к хранилищу: SQL к витрине, вызов API 1С или ERP.

  3. Считает система, модель только оформляет результат в текст.

  4. Доступ к данным идёт через MCP - стандартный протокол, по которому модель вызывает инструменты с заранее заданными правами. ### Валидатор сверяет ответ с

Источник

  1. ом Отдельный шаг извлекает числа из ответа и сравнивает их с результатом запроса.

  2. При расхождении пользователь ответа не видит: система генерирует его заново или пишет «таких данных нет».

  3. Проверка идёт параллельно с генерацией и почти не добавляет задержки. ### Шлюз держит нагрузку

  4. Запросы к моделям проходят через LLM & Security Gateway.

  5. Он ставит запросы в очередь, кэширует частые вопросы, переключается на резервную модель, когда основная упирается в лимит, и не выпускает наружу персональные и коммерческие данные. ###

  6. Словарь запрещает оценки без порога

  7. Слово «рост» допустимо только вместе с числом и периодом.

  8. Оценочные прилагательные валидатор вырезает, если в справочнике нет порога, заданного бизнесом.

Что это значит для компании без GPU-кластера

  1. Средний российский бизнес не обучает MoE-модели на сотнях ускорителей.

  2. Он подключает Qwen, GigaChat или YandexGPT по API либо разворачивает открытую модель на своём сервере.

  3. Четыре сбоя из списка NarrateAI у него те же: модель выдумывает, провайдер ограничивает, проверка тормозит, формулировки плывут.

  4. Главная метрика здесь - TTU, time to use: сколько времени проходит от запуска до первого решения, принятого с помощью инструмента.

  5. Если руководитель не доверяет ассистенту, TTU бесконечен при любой модели.

  6. Ответ в одну строку на экране выглядит просто.

  7. За ним стоят запрос к данным, сверка, очередь и словарь, и эту инженерную работу кому-то придётся сделать.

  8. Тот же принцип мы применяем в PIM-проектах: при генерации текстов карточек товаров, фасетов и таксономии.

  9. Модель предлагает текст или категорию, правила сверяют атрибуты со справочником до публикации, и человек видит только то, что прошло проверку.

Вывод

Модель выбирают за неделю. Контур, который делает её ответы пригодными для решений, строят месяцами, и четыре статьи AWS из пяти показывают, куда уходят эти месяцы. Руководитель, который однажды поймал ассистента на выдуманной цифре, скорее всего второго шанса проекту не даст. Поэтому я считаю AI-ассистента готовым, когда у каждого числа в его ответе есть адрес в источнике данных.

Источник

Обсудить статью: AI-ассистент на совещании правления: где…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: