WorldPrompt от Runway: ИИ нужны первый кадр и лента событий

Runway зафиксировала первый кадр и ленту событий, чтобы world model не дрейфовала. В бизнесе это мастер-данные и шина событий. Разбираем механику.

  • Что показала Runway
  • Та же проблема есть в компаниях
  • Первый кадр: мастер-данные
  • Лента событий: интеграционная шина

Повод

В сентябре Runway выпустила research preview модели GWM Worlds

Модель превращает генерацию видео и звука в интерактивную симуляцию в реальном времени (разбор Latent Space).

Самое полезное в релизе - формат ввода WorldPrompt

В нём автор фиксирует параметры мира, включая первый кадр, и поверх задаёт ленту событий с отметками времени.

Для бизнеса отсюда следует простое правило: ИИ работает предсказуемо, когда состояние и события описаны как данные.

Текстовый запрос в чате ложится последним, тонким слоем поверх них.

Что показала Runway

  1. World model - модель, которая по текущему состоянию среды и действию предсказывает следующее состояние. Runway называет свою архитектуру «autoregressive diffusion».

  2. Авторегрессия означает, что модель строит мир шаг за шагом и каждый следующий кадр опирается на предыдущие.

  3. Диффузия отвечает за качество самого кадра. У такой схемы есть известная слабость.

  4. Чем длиннее симуляция, тем дальше модель уходит от исходного замысла: детали плывут, объекты меняются, логика событий рвётся.

  5. Свободный текстовый промпт этого не исправляет: к сотому шагу модель опирается на свои последние кадры сильнее, чем на исходный запрос. WorldPrompt закрывает проблему инженерно.

  6. Автор фиксирует якорь - первый кадр и неизменные свойства мира.

  7. Дальше он задаёт события с временными метками: на такой-то секунде открывается дверь, на такой-то начинается дождь.

  8. Модель генерирует свободно, но в границах, которые автор описал структурой.

Та же проблема есть в компаниях

Многие компании внедряют ИИ по сценарию, от которого Runway только что отказалась. Сотрудник получает чат и спрашивает: «Какие остатки по артикулу на складе в Казани?»

Модель отвечает уверенно, а проверить ответ сотруднику нечем.

Причина та же, что в длинной симуляции

У модели нет первого кадра - единого справочника товаров, клиентов и складов: в 1С артикул записан одним способом, в Битриксе другим, в WMS третьим.

Нет и ленты событий: заказ, оплата и отгрузка лежат в трёх системах с разными часами и без общего журнала.

Недостающее модель достраивает правдоподобным текстом.

На демо такой пилот выглядит отлично.

Через два месяца в проде менеджер находит расхождение с реальными остатками, перестаёт доверять системе, и руководителю проекта приходится объяснять, куда ушёл бюджет. ИИ, который не сдвинул ни одной метрики, остаётся театром, и за этот театр в итоге отвечают конкретные люди.

Первый кадр: мастер-данные

В корпоративной архитектуре роль первого кадра играет слой мастер-данных.

Для товарного бизнеса это PIM - система, где у каждого товара один идентификатор, одна таксономия и один набор атрибутов.

Мы строим его на Akeneo и Pimcore

В наших проектах по таксономии и фасетам работа с ИИ начинается с нормализации: команда сводит категории в одно дерево, задаёт атрибутам типы и допустимые значения, записывает ручные исключения отдельными правилами.

Генерацию карточек товаров мы запускаем уже поверх этого каркаса.

Модель пишет текст по проверенным атрибутам, поэтому ошибку сразу видно: она либо в данных, либо в тексте.

Разобрать ваш контур интеграции

Лента событий: интеграционная шина

Вторая половина WorldPrompt - события с отметками времени. В компании эту роль выполняет интеграционная шина. Apache Kafka, Datareon или MuleSoft собирают в единый журнал события из всех подключённых систем: заказ создан в 10:02, оплачен в 10:05, собран в 11:40. У каждого события есть источник, время и формат. Модель, которая читает такой журнал, отвечает на вопрос «где мой заказ» записью из журнала.

Доступ к данным мы отдаём через MCP - протокол, в котором у каждого инструмента модели есть описанный контракт: какие параметры он принимает и что возвращает. Между моделью и корпоративными данными стоит LLM & Security Gateway: он контролирует, какие данные уходят наружу и кто что запрашивает.

Скучная работа сокращает TTU

  1. TTU, time to use, - время от запуска проекта до первого полезного результата.

  2. На длинной дистанции его сокращает подготовка данных, выбор модели влияет на него куда меньше.

  3. Вендоры обновляют модели раз в несколько месяцев: только на этой неделе Anthropic и OpenAI выпустили новые версии и снизили цены.

  4. Справочник и журнал событий переживают любую смену модели. К тому же выводу приходит Адриан

  5. Сэнборн в гостевой колонке Latent Space «Foundries vs Navigators».

  6. Он защитил PhD по computer science в

  7. Стэнфорде и руководит Endura Therapeutics.

  8. По его наблюдениям, в науке ИИ даёт результат через незаметные улучшения рабочих процессов в лаборатории, и эти улучшения окупаются раньше, чем громкие проекты выходят за пределы презентаций.

Вердикт

Runway потратила ресурсы исследовательской лаборатории и пришла к выводу, который интеграторы проверяют на проектах годами: управляемость генеративной модели задаёт структура данных на входе, хитрость промпта на неё почти не влияет. По нашему опыту, компании, которые сначала наводят порядок в мастер-данных и журнале событий, получают от ИИ результат за недели. Компании, которые начинают с чата, получают эффектную демонстрацию и неприятный разговор через квартал.

За простым ответом модели на вопрос про остатки стоит сложная инженерия, и делать её стоит до первого промпта.

Источник

Latent Space, «Runway’s WorldPrompt and the Engineering of Real-Time Worlds» - https://www.latent.space/p/runway.

Дополнительно: Adrian Sanborn, «Foundries vs Navigators: Lowering the Cost of Science»

, Latent Space - https://www.latent.space/p/foundries-vs-navigators-lowering.

Обсудить статью: WorldPrompt от Runway: ИИ нужны первый…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: