FRIDA Decisions: когда судье не нужна генерация

FRIDA Decisions даёт 0,893 на razvilka при 40-кратно меньшем размере, чем LLM-конкурент. Разбираем, где она заменит LLM и сколько это экономит.

  • Энкодер вместо генератора для решений из списка
  • Что умеет модель
  • Где деньги уходят впустую
  • Что показывает 0,893

Энкодер вместо генератора для решений из списка

  1. Сбер выложил в открытый доступ FRIDA Decisions.

  2. Это русскоязычная модель, которая выбирает вариант из списка, ставит оценку по шкале, отвечает «да» или «нет» и ранжирует кандидатов за один проход энкодера.

  3. Текст она не пишет, и на RTX 5060 Ti ей хватает десятков миллисекунд.

  4. На бенчмарке razvilka она набирает 0,893.

  5. Коммерческий API TypeSafe Jev получает 0,897, а LLM Qwen3.5-35B-A3B, которая в 40 раз больше, показывает сопоставимое качество.

  6. Моя гипотеза: в корпоративных ИИ-сценариях заметную долю вызовов большой генеративной модели составляют задачи классификатора, и за них платят как за генерацию.

Что умеет модель

Энкодер читает вход целиком и выдаёт решение за один проход.

Генеративная LLM пишет ответ токен за токеном, после чего из текста приходится извлекать «да», «нет» или номер варианта.

Энкодер сразу возвращает индекс, число или вероятность

У FRIDA Decisions четыре режима: - выбор одного варианта из списка; - оценка по шкале; - ответ «да» или «нет»; - ранжирование кандидатов.

За каждым режимом стоит рутинный вопрос:

  • куда направить обращение
  • пропускать ли сообщение
  • подходит ли документ под запрос
  • насколько хорош ответ

Где деньги уходят впустую

  1. Во многих внедрениях LLM вызов выглядит одинаково: модель получает текст и список меток, возвращает метку.

  2. Так устроены маршрутизация обращений в поддержку, модерация, разметка данных, проверка ответов другой модели (роль «судьи») и ранжирование фрагментов для RAG.

  3. За такой вызов компания платит токенами генерации, ждёт сотни миллисекунд или секунды и получает ответ в непредсказуемом формате.

  4. На потоке в десятки тысяч обращений в сутки это становится отдельной статьёй бюджета и очередью на шлюзе.

  5. Если судья вызывается на каждый ответ ассистента, его задержка прибавляется к задержке всей цепочки.

  6. Десятки миллисекунд на одной видеокарте потребительского класса меняют экономику такого решения.

Что показывает 0,893

  1. Сравнение на razvilka даёт три точки: открытый энкодер FRIDA Decisions набирает 0,893, коммерческий API TypeSafe Jev 0,897, а Qwen3.5-35B-A3B (MoE-модель на 35 миллиардов параметров) выходит на сопоставимый уровень.

  2. Между первым и вторым результатом четыре тысячных.

  3. Для маршрутизации и модерации такую разницу перекрывает порог уверенности. У этого результата есть граница.

  4. Бенчмарк измеряет конкретный набор задач, а ваши обращения, жаргон и сложные темы могут лежать вне его распределения.

  5. Поэтому razvilka даёт основание протестировать модель на собственной разметке и не заменяет такой тест.

  6. Мы бы начали с выборки в пару тысяч исторических решений, для которых правильный ответ уже известен.

Оценить, где ИИ даст эффект в вашем процессе

Как это встраивается в архитектуру

Схема простая. Быстрая модель стоит первой линией и закрывает случаи, в которых уверена. Спорные случаи с низкой уверенностью уходят в большую LLM или к человеку. В таком каскаде дорогой вызов достаётся небольшой части трафика, а какой именно, определяет порог на вашей разметке. В наших прикидках это диапазон 5-15%, и его нужно проверять на реальных данных.

Этот принцип мы применяем в AI-native integration для заказчиков: - В LLM & Security Gateway быстрый классификатор до генерации решает, пропускать ли запрос и в какую модель его направить. - В RAG тот же принцип работает на реранкинге: поиск отдаёт кандидатов, быстрый ранжировщик расставляет их, и в контекст большой модели попадают лучшие фрагменты. - В цепочках с MCP и n8n «да» или «нет» от лёгкой модели управляет ветвлением процесса, и разбирать свободный текст не нужно.

Чтобы получилась аккуратная картинка «обращение пришло и ушло куда надо»

, инженеры настраивают порог уверенности, считают метрики на реальных данных, логируют решения и делают откат на большую модель при дрейфе. Простой результат строится на этой сложной работе.

Русскоязычный стек взрослеет

FRIDA Decisions вышла рядом с другими открытыми русскоязычными работами

MERA Text 2.0 пересмотрела, что стоит измерять у текстовых моделей, потому что задачи первой версии 2023 года сегодня выглядят слишком простыми. GigaAM-Multilingual - семейство Conformer-моделей на 220M и 600M параметров для распознавания речи на 70+ языках.

Для русского, казахского, киргизского и узбекского это лучшее открытое качество. У заказчиков в

России и СНГ появляется набор компонентов, которые можно развернуть у себя, измерить на своих данных и заменять по отдельности.

Это касается и требований к размещению данных.

Легкая модель на собственном сервере снимает для задач классификации вопрос о передаче персональных данных во внешний API.

Что посчитать руководителю

Перед покупкой вызовов LLM под очередной сценарий стоит выяснить, какая их часть приходится на выбор из конечного списка.

Если больше половины, генерация там лишняя.

Дальше нужны три замера: качество на вашей разметке, задержка под реальной нагрузкой и доля случаев, которые каскад отправляет наверх.

Недели тестов на историческом потоке хватает, чтобы увидеть, окупается ли замена.

В этом время до результата для ИИ

Пилот на открытой модели с понятной метрикой запускают за дни, а проект на «универсальном агенте»

нередко месяцами идёт без ясного показателя

ИИ, который не двигает метрику, превращается в театр, и бюджет на него в итоге урезают.

Вердикт

FRIDA Decisions показывает: для решений из конечного списка модель в 40 раз меньше даёт сопоставимое качество за десятки миллисекунд. Генеративные LLM остаются там, где нужен текст. Классификаторы, судей и ранжировщики разумно отдать быстрым специализированным моделям, а сэкономленный бюджет направить на сценарии, которые двигают метрику.

Источник

Сбер, статья о FRIDA Decisions на Хабре. Значения 0,893 и 0,897 - оценки на бенчмарке razvilka из этой публикации.

Обсудить статью: FRIDA Decisions: когда судье не нужна…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: