AgentScope 2.0.9: агенту нужен регламент с приёмкой шагов

В AgentScope 2.0.9 появился модуль SOP: вехи с проверкой, сохранение прогона, ручной review. Разбираем, почему цепочка агента без проверок ломается.

  • Что вышло в версии 2.0.9
  • Почему агенты ломаются на длинных задачах
  • Как устроен SOP
  • Команда агентов и голос

Что вышло в версии 2.0.9

В релизе AgentScope 2.0.9 появился модуль `agentscope.sop`.

Он делит задачу на упорядоченные вехи, и агент переходит к следующей вехе только после проверки предыдущей.

По нашим наблюдениям, многие компании пилотируют AI-агентов больше года и так и не вывели их в прод.

Им стоит смотреть на этот релиз вот почему: надёжность агенту дают контрольные точки в процессе, и эту инженерную работу команде придётся сделать самой. AgentScope - открытый фреймворк для мультиагентных систем. В версии 2.0.9 три изменения: - SOP (экспериментальный модуль).

Задача делится на вехи, каждую проверяют до старта следующей.

Фреймворк сохраняет состояние прогона, и прогон можно возобновить.

Агентский сервис открывает эндпоинты `/sop`: через них хранят процедуры, запускают прогоны и вручную проверяют шаги. - TeamPipeline. Агент-лидер раздаёт задачи агентам-участникам.

Участники работают параллельно и возвращают результаты лидеру

- Голос. Realtime-агент теперь работает с OpenAI Realtime, Gemini Live и xAI Grok Voice. SOP (standard operating procedure) - стандартная операционная процедура.

Такие регламенты есть на складах и в бухгалтериях: регламент задаёт порядок действий и точки, где ответственный проверяет результат.

Почему агенты ломаются на длинных задачах

  1. Допустим, агент выполняет один шаг правильно в 95% случаев.

  2. Тогда цепочка из 10 шагов без проверок пройдёт без ошибки примерно в 60% случаев (0,95 в десятой степени).

  3. При точности 90% на шаг останется 35%.

  4. Цифры условные, механизм реальный: ошибка на третьем шаге незаметно доходит до десятого, и на выходе получается аккуратно оформленный неверный результат. Пример из интеграционной практики.

  5. Агент сопоставляет прайс поставщика с каталогом в PIM, пересчитывает цены и выгружает их в 1С.

  6. Если агент перепутал артикулы при сопоставлении, выгрузка всё равно пройдёт без технических ошибок, и неверные цены первыми увидят покупатели.

  7. Обычно компании в такой ситуации переходят на более мощную модель.

  8. Точность на шаге вырастает на несколько процентов, но цепочка без проверок остаётся хрупкой: каждая дополнительная ступень снова умножает вероятность сбоя.

Как устроен SOP

  1. Веха - это кусок работы с заранее заданным критерием готовности.

  2. Агент выполняет веху, затем код или человек через `/sop` проверяет её, и только после этого стартует следующая.

  3. Если проверка не прошла, агент повторяет одну эту веху, а прогон с начала перезапускать не нужно.

  4. Сохранённое состояние решает вторую проблему продакшена.

  5. Если упал сервис, истёк таймаут у API провайдера или оператор остановил процесс на ночь, прогон продолжится с последней принятой вехи.

  6. Для задачи, которая идёт часами и расходует токены, это прямая экономия денег.

  7. Ручная проверка через API позволяет вставить в процедуру подпись ответственного сотрудника там, где ошибка дорого стоит: при изменении цен, отправке документов в ЭДО, записи проводок в учётную систему.

  8. Инженеры давно применяют эту логику в CI/CD: сборка попадает в прод только после тестов.

  9. Разработчики AgentScope перенесли её на агентов.

  10. Модуль помечен как экспериментальный, его API ещё может поменяться, поэтому строить на нём критичный прод сегодня рискованно.

  11. Сам принцип можно применять уже сейчас на любом фреймворке или на собственном оркестраторе.

Оценить, где ИИ даст эффект в вашем процессе

Команда агентов и голос

  1. TeamPipeline ускоряет задачи, которые делятся на независимые части: разбор пачки договоров, проверку карточек товаров по категориям, сверку остатков по складам. У параллельности есть цена: каждый участник тратит свои токены и добавляет свою точку отказа.

  2. Если результаты участников никто не проверяет, лидер собирает итог из непроверенных кусков.

  3. Поэтому мы используем SOP и TeamPipeline в паре: участники работают параллельно внутри вехи, а на её границе результат проверяют.

  4. Три голосовых провайдера позволяют выбрать по цене, задержке и качеству речи. У российских компаний есть дополнительный вопрос: голос клиента в звонке содержит персональные данные, и передачу таких данных зарубежному провайдеру юристам нужно проработать отдельно, до запуска пилота.

Что делать компании, которая внедряет агентов

  1. Четыре правила, которые мы применяем в проектах AI-native integration: 1. Сначала регламент, потом модель.

  2. Если сотрудник не может перечислить шаги процесса и критерии приёмки каждого шага, агент с этим процессом тоже не справится. 2. Машинная проверка там, где она возможна.

  3. Сверка сумм, валидация по JSON-схеме, контрольные остатки.

  4. Человека подключаем там, где ошибка обходится дороже его времени. 3. Сохранённое состояние.

  5. Длинный процесс должен переживать сбой без потери выполненной работы. 4. Модели за шлюзом.

  6. Наш LLM & Security Gateway логирует запросы, маскирует персональные данные и позволяет сменить провайдера (GigaChat, YandexGPT, Qwen, Claude) без переписывания агента.

  7. Агент получает доступ к 1С, PIM и CRM через MCP-серверы с ограниченными правами.

  8. Шаги оркестрации и события проходят через Kafka или n8n, поэтому каждая веха видна в логах, и её можно перезапустить отдельно. Снаружи схема выглядит простой.

  9. Чтобы она работала, команда до первого демо строит контракты данных, тесты и мониторинг.

Вывод

Релиз 2.0.9 закрепил в коде вывод, к которому команды пришли через дорогие пилоты: агенту нужен регламент с приёмкой на каждом шаге. Скорее всего, модели продолжат дешеветь и умнеть. Компании, которые уже описали свои процессы как проверяемые вехи, подключат новую модель за день и выиграют по TTU - времени до получения результата. Остальные будут показывать руководству демо, пока бюджет на демо не закончится.

Источник

AgentScope v2.0.9 - release notes, авторы - команда AgentScope (agentscope-ai), лицензия проекта Apache-2.0.

Обсудить статью: AgentScope 2.0.9: агенту нужен регламент…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: