Haiku 5.5 по цене Luna: что делать с токеном за $0,10

Haiku 5.5 стоит $0,10/$0,50 за млн токенов, как GPT-6 Luna. Считаем экономику, пороги контекста и как не привязаться к вендору.

  • Что произошло
  • Арифметика на реальной задаче
  • Ступенька на 100 000 токенов
  • Decisions API: платить только за вход

Что произошло

Anthropic выпустила Claude Haiku 5.5, быструю и дешёвую модель, и поставила ей цену $0,10 за миллион входных и $0,50 за миллион выходных токенов.

Предыдущий Haiku 4.5 стоил $1 и $5.

Когда два вендора продают малую модель по одной цене, экономику проекта определяют три вещи: пороги контекста, качество на вашей задаче и стоимость смены поставщика. Haiku 4.5 вышел почти год назад.

Уже тогда он был дорогим для своего класса, а в сентябре GPT-6 Luna стала в десять раз дешевле. Haiku 5.5 закрыл этот разрыв: $0,10/$0,50 действуют до 100 000 токенов в запросе.

Выше порога цена вырастает в пять раз, до $0,50/$2,50

У Luna порог стоит на 272 000 токенах, и подорожание после него мягче: до $0,20 за вход и $0,75 за выход.

Первая ступень у моделей одинаковая, а дальше цены расходятся, поэтому на длинных контекстах итоговый счёт будет разным.

Арифметика на реальной задаче

Возьмём типовую фоновую операцию: классификацию или обогащение записей

Допустим, 100 000 запросов в месяц, в каждом по 20 000 входных токенов (инструкция, примеры, документ) и по 500 выходных. - Вход: 2 млрд токенов.

На Haiku 4.5 это $2 000, на Haiku 5.5 это $200. - Выход: 50 млн токенов.

На Haiku 4.5 это $250, на Haiku 5.5 это $25. -

Итого $2 250 против $225 в месяц при прочих равных.

Цифры расчётные, на тарифах из анонса.

Они показывают порядок величины: задача, которая вчера не проходила по бюджету, при такой разнице в цене может окупиться за первый месяц.

Ступенька на 100 000 токенов

  1. При таких тарифах риск сидит в длинных запросах.

  2. Запрос на 99 000 входных токенов стоит около $0,01.

  3. Запрос на 101 000 токенов по верхнему тарифу выйдет примерно на $0,05, если новая цена применяется ко всему запросу.

  4. Если она применяется только к токенам сверх порога, разница будет меньше. Заметка

  5. Уиллисона этого не уточняет, поэтому условие нужно проверить в документации Anthropic до того, как закладывать бюджет.

  6. Для архитектуры отсюда следует простое правило: контекст нужно считать и ограничивать. Агент, который на каждом шаге добавляет в промпт всю историю диалога, пересечёт порог незаметно, и счёт вырастет в пять раз без единой правки в коде.

  7. Для этого существует RAG: из базы знаний в модель попадают нужные 5-10 тысяч токенов, а корпус целиком остаётся в хранилище.

Оценить, где ИИ даст эффект в вашем процессе

Decisions API: платить только за вход

  1. В те же дни OpenAI выпустила Decisions API, а

  2. Уиллисон сделал для него плагин llm-openai-decisions.

  3. Модель gpt-6-luna в этом режиме принимает текст и изображения, и деньги берутся только за вход: 10 центов за миллион токенов. У конкурирующего Jev принцип такой же, а цена ниже, 4,2 цента.

  4. Это подходит для задач с коротким структурированным ответом: выбрать категорию, подтвердить соответствие, принять решение по правилу.

  5. Стоимость операции известна заранее, потому что зависит только от размера входа, а его контролируем мы сами.

Что это меняет для интегратора

  1. Прайс-лист меняется раз в месяц, а интеграция живёт годами.

  2. Поэтому вызовы моделей не стоит зашивать в бизнес-логику.

  3. Мы строим их через LLM & Security Gateway: единую точку, через которую идут запросы, где считаются токены, применяются лимиты на размер контекста и фильтруются данные.

  4. Смена Haiku на Luna или обратно в такой схеме сводится к правке маршрута, а код сервиса остаётся прежним. То же относится к инструментам.

  5. Если у модели есть доступ к системам через MCP, при замене поставщика меняется только модель, а набор инструментов остаётся на месте.

  6. Это и есть AI-native интеграция: вокруг модели построен слой, который от конкретной модели не зависит, и поэтому модель можно заменить.

  7. Дешёвые токены нужнее всего там, где операций много: массовое обогащение карточек товаров, расстановка фасетов, поддержка таксономии, правки тегов в каталогах на Pimcore или Akeneo.

  8. На такой нагрузке разница между $2 250 и $225 в месяц попадает в смету.

  9. Решение о переходе стоит принимать после замера качества на собственных данных.

Вердикт

  1. Скидка в десять раз открывает много задач.

  2. Следить стоит за стоимостью решённой задачи: цена токенов, умноженная на число попыток, плюс цена ошибки.

  3. Дешёвая модель, которая ошибается вдвое чаще, может обойтись дороже.

  4. Это проверяется замером на 200-300 размеченных примерах.

  5. Мой порядок действий: взять два-три реальных процесса, прогнать их через обе модели, посчитать стоимость верного результата и убедиться, что запросы остаются ниже порога в 100 000 токенов.

  6. По нашей оценке, на выбор модели после этого уйдёт около одного дня.

  7. Когда цены у поставщиков совпадают, решает качество на ваших данных.

Обсудить статью: Haiku 5.5 по цене Luna: что делать с…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: