Haiku 5.5 дешевле на 75%: что делать с агентами в проде

Haiku 5.5 на Bedrock стоит на 75% дешевле Haiku 4.5. Разбираем, где субагенты окупаются и почему права доступа важнее цены токена.

  • Что случилось
  • Что изменила цена
  • Как это выглядит на реальной задаче
  • От диагноза к исправлению

Что случилось

  1. AWS добавила Claude Haiku 5.5 в Amazon Bedrock.

  2. По данным Anthropic, это самая быстрая и эффективная модель семейства 5.5.

  3. Её сделали для субагентов и массовых задач, где важна цена, и для большинства задач она стоит примерно на 75% дешевле Haiku 4.5.

  4. Когда вызов модели дешевеет в четыре раза, бюджет перестаёт быть главным ограничением для агентов в эксплуатации.

  5. Остаются два вопроса: какие данные агент вправе читать и кто отвечает за исправление, которое он предлагает.

Что изменила цена

  1. Субагент - узкий исполнитель внутри большой системы.

  2. Один агент читает логи, другой выполняет запросы к системным представлениям базы, третий сверяет результат с регламентом.

  3. Каждый делает много коротких вызовов, их тысячи, поэтому счёт определяют дешёвые и быстрые модели.

  4. Снижение цены примерно на 75% по сравнению с Haiku 4.5 меняет арифметику: схему, которую раньше считали слишком дорогой для постоянной работы, можно пересчитать заново. Bedrock добавляет к модели условия, которые проверяет служба безопасности.

  5. Данные остаются внутри инфраструктуры AWS с региональной привязкой, а доступ регулируется через IAM, теми же ролями, которыми команда уже пользуется.

  6. Если компания не готова отправлять внутренние данные во внешний API, пилот без этих условий не стартует.

Как это выглядит на реальной задаче

  1. Cornerstone OnDemand обслуживает 140 миллионов пользователей в 186 странах.

  2. Раньше команда DataOps тратила до 45 минут на один инцидент с базой: вручную опрашивала системные представления и сопоставляла результаты.

  3. Теперь работает мультиагентная система Orion AI на Amazon Bedrock и Strands Agents, открытом фреймворке AWS для оркестрации агентов.

  4. Специализированные агенты разбирают инцидент параллельно.

  5. Компания заявляет сокращение времени диагностики на 78%.

  6. Если взять потолок в 45 минут, получится около десяти минут вместо трёх четвертей часа.

  7. Это наш расчёт по заявленным цифрам, независимого измерения нет, поэтому применять его стоит осторожно.

  8. Механика простая: оркестратор делит задачу, субагенты выполняют узкие проверки, результат собирается в один вывод.

  9. Дешёвая быстрая модель в роли субагента делает такую схему экономически разумной.

Оценить, где ИИ даст эффект в вашем процессе

От диагноза к исправлению

  1. AWS DevOps Agent круглосуточно разбирает инциденты по метрикам, логам и топологии приложения.

  2. На выходе он выдаёт анализ первопричины (RCA) и рекомендуемые действия.

  3. Дежурный инженер среди ночи получает готовый диагноз, но исправление делает вручную.

  4. Новая статья AWS описывает следующий шаг: автоматизировать исправление после расследования агента. Здесь появляется ответственность.

  5. Диагноз ничего не ломает, а исправление меняет прод.

  6. Рабочая схема требует трёх вещей: - ограниченный набор разрешённых действий; - журнал, из которого видно, что агент сделал и почему; - точка, где человек подтверждает рискованный шаг.

  7. Без них автоматическое исправление становится источником новых инцидентов.

  8. Мы в KT.Team закладываем такие контуры на этапе проектирования интеграции, до первой аварии.

Права доступа решают судьбу RAG

  1. RAG (retrieval augmented generation) - схема, где модель отвечает по найденным документам компании из SharePoint, Google Drive, Confluence. В этих системах у каждого документа свой список прав.

  2. Если ассистент отвечает по материалам, которые сотрудник не вправе видеть, это утечка, даже когда формулировка ответа безобидна. Amazon Quick вместе с Amazon Bedrock Knowledge Bases проверяет права в момент запроса: сверяет списки контроля доступа (ACL) в источнике и не копирует их заранее в индекс. Разница существенная.

  3. Скопированные права устаревают в тот же день, когда сотрудника переводят в другой отдел.

  4. Проверка в момент запроса видит актуальное состояние.

  5. Для российских компаний тот же принцип применим к 1С,

  6. Битрикс и корпоративным базам знаний: слой доступа определяет, можно ли вообще запускать RAG на данных, поэтому его строят до выбора модели.

Люди, которые строят

  1. AWS отдельно описывает, как сократить разрыв между разговорами об ИИ и созданием решений.

  2. По её оценке, главный барьер внедрения - нехватка практики у специалистов, чья работа не связана с кодом, но всё больше зависит от ИИ.

  3. Им нужны инструменты, структурированная поддержка и право на ошибку.

  4. Это совпадает с нашим опытом: рабочие агенты появляются там, где владелец процесса участвует в сборке решения вместе с инженерами.

Вердикт

Дешёвая модель снимает аргумент про стоимость.

Он был удобным: за ним можно было неделями откладывать решение.

Теперь остаётся спросить, что агент вправе читать, что вправе менять и какая метрика улучшилась после его запуска.

Диагностика на 78% быстрее - измеримый результат.

Формулировка «мы внедрили ИИ» метрики не содержит

Компании, которые не привяжут агентов к ролям доступа и к измеримому результату, рискуют получить дорогой эксперимент, а их конкуренты, если заявленные цифры подтвердятся, будут закрывать инцидент за десять минут вместо сорока пяти.

Обсудить статью: Haiku 5.5 дешевле на 75%: что делать с…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: