Сложение словами: тест перед внедрением ИИ

Эксперимент с Qwen3.8 27B показывает, как за вечер найти порог ошибок модели и не потерять бюджет на внедрении ИИ.

  • Что проверяли
  • Где это встречается в бизнесе
  • Как повторить проверку
  • Граница ответственности

Повод

  1. Саймон Уиллисон повторил на локальном железе (DGX Spark) эксперимент Колина Фрейзера.

  2. Модель складывает числа и возвращает сумму словами, а размер чисел растёт. Два года назад

  3. Фрейзер прогнал тот же тест на GPT-4o, и модель часто ошибалась. Новый прогон

  4. Уиллисон сделал на Qwen3.8 27B (разбор Уиллисона).

  5. Меня интересует схема эксперимента.

  6. Руководитель может провести такую проверку на своей задаче за вечер, и она обойдётся дешевле одной ошибки в проде.

Что проверяли

  1. Задача выглядит детской: сложить два числа и записать результат прописью.

  2. Фрейзер усложнял её ступенями, увеличивая разрядность слагаемых, и строил график доли верных ответов.

  3. Уиллисон отмечает, что GPT-4o не мог пользоваться калькулятором.

  4. Поэтому его ошибки показывают, где кончается способность модели считать самостоятельно. У теста есть однозначный эталон.

  5. Сумму считает обычный код, затем сравниваются строки.

  6. Спорить о «качестве» ответа не приходится. Я опираюсь только на описание эксперимента.

  7. Результаты Qwen3.8 27B в приведённом отрывке не показаны, поэтому цифр по ним я не называю. График смотрите в оригинале.

Где это встречается в бизнесе

У компании, которая внедряет ИИ, есть три типовых места, где модель работает с числами: - сверка счетов и актов в ЭДО: суммы, НДС, итоги по спецификации; - выгрузки из 1С и Битрикса, которые модель пересказывает в отчёт для руководителя; - карточки товаров в PIM: габариты, остатки, цены с пересчётом единиц. Демо на трёх коротких примерах в каждом из этих случаев проходит гладко.

Сбои, как правило, появляются на длинных числах, больших таблицах и редких форматах. Кривая «точность против размера входа»

в эксперименте Фрейзера показывает такую границу. Бюджет проекта тратится уже после неё.

Как повторить проверку

Проверка состоит из четырёх шагов.

Берём задачу, у которой эталонный ответ получается обычным кодом.

Генерируем входы с нарастающей сложностью: длиннее числа, больше строк, грязнее формат.

Прогоняем модель в контролируемой среде

Локальный запуск даёт фиксированные веса, известные параметры и отсутствие скрытых инструментов. Результаты воспроизводятся, и версии модели можно сравнивать между собой.

Строим график и находим порог, после которого доля ошибок перестаёт устраивать бизнес. Первая проба стоит скрипта на несколько десятков строк и вечера работы инженера. Если порог лежит ниже реальных объёмов, задачу отдают детерминированному коду. Модель при этом отвечает за понимание запроса и оформление результата.

Разобрать вашу задачу с архитектором

Граница ответственности

Модель хорошо понимает намерение, разбирает неструктурированный текст и выбирает нужный вызов. Арифметику, сверку и агрегацию надёжнее поручать коду. В архитектуре это выглядит так: модель получает инструменты через MCP, вызывает функцию расчёта и возвращает результат человеку. Сам расчёт выполняет код. Вторая часть защиты - проверка ответа до попадания в учётную систему. В нашем LLM & Security Gateway на выходе стоит валидатор: он сверяет суммы и форматы и отбраковывает подозрительное.

Для вопросов по документам мы используем RAG, и цифры берутся из источника, без восстановления по памяти модели.

Выбор модели проходит через тот же тест

  1. В тот же период вышла Kimi-K3 от Moonshot AI: 2,8 трлн параметров, открытые веса, $3 и $15 за миллион токенов на входе и выходе.

  2. Лицензия нестандартная и требует коммерческого соглашения, если выручка от MaaS превышает $20 млн.

  3. Для выбора модели эти условия весят не меньше размера.

  4. Каталог моделей быстро растёт, а пресс-релизы плохо подходят для сравнения.

  5. Надёжнее мерить долю верных ответов на ваших данных и цену за правильный результат.

  6. То же касается места, где работает ИИ-агент. Феликс

  7. Ризеберг из Anthropic пишет, что прежняя версия Cowork запускала ВМ на компьютере пользователя, а инференс шёл в облаке.

  8. Пользователям не нравились расход диска и батареи, а работа останавливалась при закрытии ноутбука. В новой версии и инференс, и ВМ живут в облаке, у каждой сессии своя песочница.

  9. Среда исполнения влияет на результат и стоимость владения так же, как модель, и измерять её стоит тем же способом.

Вывод

ИИ, который не двигает метрику, остаётся театром, а за театр платит руководитель. Тест Фрейзера и Уиллисона задаёт порядок: сначала эталон и кривая сложности, потом решение о внедрении. Интерфейс, где пользователь пишет запрос и получает верную сумму, держится на тестовых наборах, инструментах для вычислений и проверке выхода. Модель, которая уверенно называет неверную сумму прописью, обходится дороже модели, которая передаёт расчёт коду.

Источник

Саймон Уиллисон, «Qwen3.8 27B addition in words», simonwillison.net. Исходный эксперимент с GPT-4o: Колин Фрейзер (Bluesky). Дополнительно использованы заметки Уиллисона о Kimi-K3 и цитата Феликса Ризеберга о Cowork.

Обсудить статью: Сложение словами: тест перед внедрением ИИ

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: