Агенту нужен чистый документ: почему извлечение важнее модели

Microsoft: успех AI-агента зависит от качества разбора PDF и сканов. Разбираем, как устроен слой извлечения и где на нём ломаются пилоты.

  • Повод: Microsoft вернулась к разбору PDF
  • Пять лет LLM, а документы прежние
  • Где ломается агент
  • Как устроен слой извлечения

Повод: Microsoft вернулась к разбору PDF

Главный тезис авторов: успех корпоративного ИИ зависит от того, может ли агент доверять контенту, с которым работает.

По их оценке, выбор модели влияет на результат меньше

Я с этим согласен и добавлю из опыта интегратора: в AI-проекте больше всего работы уходит на разбор PDF, сканов и выгрузок поставщиков.

На этом этапе проект либо даёт результат, либо тихо закрывается.

Пять лет LLM, а документы прежние

  1. Microsoft пишет прямо: большие языковые модели существуют уже пять лет, за это время модели стали сильнее, а контент стал грязнее.

  2. По оценке авторов, основная инженерная работа сводится к тому, чтобы превратить сырой PDF, картинку или аудиофайл в проверяемую информацию, на основе которой агент может действовать.

  3. Извлечение контента (content extraction) - это слой между файлом и моделью.

  4. Он распознаёт текст, восстанавливает структуру (заголовки, колонки, таблицы), вытаскивает поля и запоминает, где в исходнике лежит каждое значение.

  5. Одна только спецификация формата PDF, ISO 32000-2, занимает около тысячи страниц. Прайс-лист на экране выглядит аккуратной таблицей, а внутри файла он хранится как набор разрозненных текстовых фрагментов с координатами.

  6. На той же неделе Microsoft выпустила версию dotnet-1.23.0 своего Agent Framework.

  7. Частые релизы показывают, что вендоры сделали оркестрацию агентов стандартной библиотекой для C# / .NET и Python.

  8. Команда может собрать агента за день, но научить его правильно читать документы компании за такой срок у неё не получится.

Где ломается агент

  1. Возьмём типичный сценарий: агент получает счёт или спецификацию поставщика и заносит позиции в 1С.

  2. Ошибки возникают уже на входе: - в таблице с объединёнными ячейками парсер перепутал порядок строк, и цена одной позиции досталась соседней; - в скане печать перекрыла цифру, и OCR прочитал «8» как «3»; - в выгрузке из Excel единица измерения указана в заголовке колонки, поэтому «12» без контекста может означать и штуки, и коробки.

  3. Ошибку модели в рассуждении обычно видно сразу.

  4. Плохо извлечённый документ даёт правдоподобный ответ с неверной цифрой, и агент уверенно проводит его в учётную систему.

  5. Дальше появляется неправильная цена на витрине, пересорт на складе и ручная сверка задним числом.

  6. После пары таких случаев финансовый директор закрывает пилот, и упрекнуть его за это сложно.

Как устроен слой извлечения

  1. ### Разбор структуры Сначала система восстанавливает макет страницы: порядок чтения, колонки, таблицы, подписи.

  2. Для сканов к этому добавляется OCR.

  3. Задача шага: таблица из 40 строк на выходе должна остаться таблицей из 40 строк с теми же связями между ячейками. ### Нормализация

  4. Затем система приводит значения к справочникам компании: артикулы к номенклатуре, единицы измерения к базовым, даты к одному формату.

  5. Для этого нужны мастер-данные, поэтому результат шага зависит от качества PIM и НСИ. ### Привязка к

Источник

у Каждое поле хранит ссылку на страницу и координаты в исходнике. Microsoft называет это grounded, verifiable information.

Сотрудник кликает на цену и видит, откуда она взялась

RAG (поиск по базе знаний перед ответом модели) работает на тех же фрагментах, поэтому качество ответов тоже зависит от разбора. ### Порог уверенности

Поля с низкой уверенностью распознавания система отправляет оператору, остальные проходят автоматически.

Команда подтверждает правила, и доля автоматической обработки растёт постепенно.

Никто не ставит на то, что модель «сама разберётся».

Оценить, где ИИ даст эффект в вашем процессе

Что это значит для бизнеса

Правило из моей практики (у Microsoft его нет): прежде чем сравнивать модели, возьмите 50 реальных документов из своего потока и измерьте точность извлечения по каждому полю. Если цена и артикул извлекаются хуже, чем требует учёт, более дорогая модель проблему не решит. TTU (time to use, время до первой пользы) в таких проектах определяет скорость, с которой команда получила чистые данные на входе. Демо на трёх красивых PDF эту метрику не покажет.

Как мы это закрываем

В проектах KT.Team извлечение контента чаще всего нужно при наполнении каталога.

Поставщики присылают прайсы, спецификации и паспорта товаров, а на выходе требуется карточка в Pimcore или Akeneo.

Мы извлекаем атрибуты из файлов, раскладываем товары по таксономии, собираем из атрибутов фасеты для фильтров каталога и генерируем тексты карточек только по подтверждённым полям.

Каждое значение хранит ссылку на исходник, поэтому контент-менеджер открывает спорное место за секунды и не перечитывает документ целиком.

Вокруг этого мы строим инфраструктуру

LLM & Security Gateway маскирует персональные и коммерческие данные до отправки в модель и логирует каждый вызов.

Через MCP агент получает доступ к уже извлечённым и нормализованным данным, сырые файлы до него не доходят.

Модель подбираем под контур:

  • для российского периметра это GigaChat
  • YandexGPT или Qwen на своих серверах
  • для остальных задач - Claude
  • OpenAI

Когда слой извлечения сделан хорошо, замена модели занимает около дня.

Вердикт

  1. Microsoft через пять лет после старта эпохи LLM возвращается к разбору PDF, и это честный сигнал рынку.

  2. Вендоры быстро делают модели и фреймворки агентов стандартными компонентами.

  3. Преимущество получит компания, чей агент читает счёт так же точно, как опытный бухгалтер, и показывает, где именно в документе нашёл цифру.

  4. Если бюджет AI-проекта ушёл на выбор модели и на разбор документов денег не осталось, пилот закончится неверными цифрами в учётной системе.

Источник

Why content extraction still matters in the GenAI era - Azure AI team, Microsoft Foundry Blog. Материал Microsoft, права принадлежат автору.

Обсудить статью: Агенту нужен чистый документ: почему…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: