openJiuwen 0.1.19: самообучающемуся агенту метрику задаёт бизнес

Reward Engine, онлайн-эволюция и команды агентов в openJiuwen 0.1.19. Разбираем, какие три условия нужны бизнесу до запуска самообучения в прод.

  • Что вошло в релиз
  • Зачем агенту функция награды
  • Где самоэволюция ломается в проде
  • Команды агентов и навыки как пакеты

Повод

29 сентября 2026 года команда открытого агентного фреймворка openJiuwen agent-core выпустила версию 0.1.19. В релиз вошли RFC движка наград (Reward Engine), двухконтурная онлайн-эволюция агента, оркестрация команд агентов и пакетная установка навыков. Для компании, которая внедряет агентов, из релиза следует простой вывод: агент, который дообучается в работе, полезен ровно настолько, насколько точно ему описали результат.

Если метрики нет, самообучение усиливает ошибку.

Что вошло в релиз

  1. Авторы выделяют шесть направлений: самоэволюция агента, оркестрация команд, жизненный цикл навыков (Skill), надёжность рантайма, безопасность и наблюдаемость.

  2. Конкретные изменения: - Reward Engine RFC.

  3. Проект спецификации модуля, который оценивает действия агента и выдаёт числовую награду.

  4. От этой оценки зависит, какое поведение агент закрепит. - TTSE dual-track online evolution.

  5. Агент меняет поведение на лету по двум параллельным трекам.

  6. Архитектура описана в RFC, поэтому детали стоит сверять с исходниками. - Team Organization и планировщик.

  7. Несколько агентов получают роли, планировщик распределяет между ними задачи. - Proactive Context Service.

  8. Сервис подбирает агенту контекст заранее, до запроса. - Skill-пакеты.

  9. Навыки ставятся как пакеты, встроенные навыки доступны сторонним агентам. - Потоковые аргументы tool-call и расширенные файловые инструменты.

  10. Интерфейс получает аргументы вызова инструмента по частям и может показывать прогресс. В список исправлений попали восстановление команды агентов после сбоя, оценка RSI (recursive self-improvement, рекурсивное самоулучшение) и интеграция с memory-server.

  11. Судя по этим пунктам, слабые места фреймворка сейчас находятся в отказоустойчивости команд и в памяти агента.

Зачем агенту функция награды

  1. Обычный LLM-агент работает по инструкции: промпт, инструменты, ответ.

  2. Ошибку он повторит, пока инженер не поправит промпт.

  3. Самоэволюционирующий агент собирает сигнал о качестве своих действий и по нему корректирует стратегию. Этот сигнал и называется наградой. Награду определяет человек.

  4. Если агент службы поддержки получает награду за закрытый тикет, он научится закрывать тикеты, и доля решённых проблем при этом может упасть. В машинном обучении это называется reward hacking: система оптимизирует число, которое бизнесу не нужно.

  5. Поэтому внедрение Reward Engine упирается в зрелость управления раньше, чем в код. Руководитель, который не может сформулировать метрику результата для сотрудника, не сформулирует её и для агента.

Оценить, где ИИ даст эффект в вашем процессе

Где самоэволюция ломается в проде

Возьмём агента, который обогащает карточки товаров в PIM: дописывает описания, проставляет атрибуты, связывает товары с таксономией.

Если платить ему за «заполненность карточки»

, поля заполнятся правдоподобной чепухой.

Если платить за конверсию карточки, сигнал придёт через недели, и агент будет учиться на шуме. В наших проектах по наполнению каталогов (фасеты, тексты карточек, таксономия, ручные переопределения тегов) работает такая схема.

Агент предлагает изменение, валидатор проверяет его по правилам справочника, редактор выборочно подтверждает, а в историю записывается, кто и что изменил.

Обратная связь от валидатора и редактора играет роль награды, которую можно проверить и откатить.

Из этого следуют три условия, без которых онлайн-эволюцию в прод выпускать рано: 1. Метрика с владельцем.

Конкретный человек отвечает за число, по которому учится агент. 2. Журнал решений.

Каждое изменение поведения агента видно в логах и связано с наградой, которая его вызвала. 3. Откат.

Агента можно вернуть к версии прошлой недели за минуты

С третьим условием у openJiuwen, по нашей оценке, пока не всё гладко: в релизе чинили восстановление команды агентов после сбоя.

Команды агентов и навыки как пакеты

Оркестрация команд и Skill-пакеты закрывают инженерную задачу, на которой спотыкаются пилоты. Навык, который ставится как пакет, получает версию, зависимости и процедуру обновления, как любая библиотека.

Для интегратора это вопрос TTU (time to use): сколько времени проходит от «нашли полезный навык»

до «навык работает у заказчика». Доступ сторонних агентов к встроенным навыкам решает ту же задачу, что протокол MCP: инструмент описывают один раз и подключают к разным агентам. Так мы строим интеграции агентов с 1С, PIM и ESB. Инструменты агента живут в MCP-серверах, запросы к моделям идут через LLM & Security Gateway, события бизнес-систем приходят через Apache Kafka. Каждый компонент заменяется отдельно, и при смене фреймворка оркестрации интеграции переписывать не нужно.

Proactive Context Service работает как RAG с упреждением: система заранее выбирает документы, которые понадобятся агенту. Упреждение сокращает время ответа и одновременно расширяет поверхность утечки. Если сервис сам подтягивает контекст, права доступа к данным нужно проверять до модели, на уровне шлюза.

Что делать с этим бизнесу

Версия 0.1.19 относится к раннему фреймворку с амбициозной дорожной картой, и самые интересные функции пока описаны только в RFC. Практичная стратегия: - опробовать идею управляемой награды на своём агенте с понятной метрикой: доля карточек, прошедших валидацию, или доля обращений без повторного контакта; - держать слой инструментов и доступа к моделям независимым от фреймворка, чтобы смена оркестратора заняла дни; - включать онлайн-эволюцию там, где ошибка агента стоит дёшево и откатывается.

Вердикт

Судя по openJiuwen, самообучающиеся агенты придут в корпоративные системы в виде наград, навыков-пакетов и команд с планировщиком. Эту часть напишут разработчики фреймворков. Метрику результата, журнал решений и откат компании придётся строить самой. Агент, обученный на плохой метрике, быстро и уверенно ведёт процесс к провалу, и отвечать за провал будет руководитель, который его запустил.

Обсудить статью: openJiuwen 0.1.19: самообучающемуся…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: