Пятикратное падение цены токена не окупает AI-проекты

Sol по $2/$10 против $10/$50 у Astra. Считаем стоимость запроса и объясняем, почему дешёвая модель не окупает AI-проект сама.

  • Строка в выпуске, которая меняет бюджеты
  • Что известно из источника
  • Арифметика на одном запросе
  • Где проект ломается

Строка в выпуске, которая меняет бюджеты

В выпуске AINews за 1-2 октября редакция пишет, что ничего особенного не случилось. В нём при этом есть строка, которая меняет бюджеты: OpenAI поставила GPT-6.1 Sol по $2 за миллион входных и $10 за миллион выходных токенов, а у Astra те же позиции стоят $10 и $50.

Цена упала в пять раз по обеим позициям, и вопрос «сколько стоит модель»

теряет вес. Руководителю теперь нужно понять, кто доведёт модель до результата в бизнес-процессе. Первоисточник: Latent Space, AINews «not much happened today».

Что известно из источника

  1. Latent Space в обзоре AI Twitter описывает запуск GPT-6.1 Sol и Sonnet 5.5 как сдвиг границы «стоимость-качество». Цифры, которые подтверждает обзор: Sol стоит $2/$10 за миллион входных/выходных токенов, Astra стоит $10/$50.

  2. Там же сообщается, что Sol обходит GPT-6 Sol на 6,4 пункта.

  3. По какому бенчмарку, из имеющегося у нас фрагмента неясно.

  4. Поэтому качество мы сравниваем только после собственного прогона на своих данных, а цифре из твита не доверяем.

Арифметика на одном запросе

Возьмём типовую задачу внутри компании: разбор договора или карточки товара.

На входе 20 тысяч токенов контекста, на выходе 2 тысячи.

Это расчёт для иллюстрации, реальные объёмы у каждого свои.

На Astra запрос стоит $0,20 за вход и $0,10 за выход, всего $0,30.

На Sol он стоит $0,04 и $0,02, всего $0,06.

При 100 тысячах запросов в месяц получается $30 000 против $6 000.

Разница в $24 000 в месяц сопоставима с зарплатой хорошего инженера.

Из расчёта следуют два вывода

Первый:

  • сценарии
  • которые не окупались при $0
  • 30 за запрос
  • при $0
  • 06 считаются иначе

Это массовая классификация, сверка документов, ответы по базе знаний. Второй вывод неприятнее.

Если AI-проект не двигает метрику при затратах в $30 000, он не сдвинет её и при $6 000, просто обойдётся дешевле.

Где проект ломается

  1. По нашей оценке, в типичном проекте токены занимают малую часть стоимости владения.

  2. Основные деньги уходят на подготовку данных, интеграцию с учётными системами, контроль качества ответов и безопасность.

  3. Дешёвая модель убирает самую заметную строку в смете, остальные строки остаются прежними.

  4. Дешёвые выходные токены создают отдельный эффект.

  5. Когда генерация подешевела в пять раз, команды просят модель писать больше: развёрнутые отчёты, длинные описания, многошаговые рассуждения.

  6. Объём растёт, а время до результата для пользователя может остаться прежним.

  7. Мерить стоит TTU (time to use), то есть время от запроса до применимого результата.

  8. Число сгенерированных страниц о результате ничего не говорит.

Оценить, где ИИ даст эффект в вашем процессе

Как это закрывается технически

  1. Цены падают, модели выходят каждые несколько недель, и компании нужен собственный слой между моделью и бизнес-процессом.

  2. Он решает четыре задачи. Маршрутизация.

  3. Запрос уходит на модель, подходящую по цене и качеству именно для этой задачи: классификация на дешёвую, юридическая экспертиза на сильную. В LLM & Security Gateway KT.Team это одна точка входа с политиками.

  4. Смена провайдера (OpenAI, Anthropic Claude, Google Gemini или Sber GigaChat) сводится к правке строки в конфигурации, код приложений остаётся прежним. Контекст.

  5. Из 20 тысяч входных токенов в примере выше полезна только часть. RAG отбирает нужные фрагменты, вход сокращается в разы, точность растёт.

  6. Такая экономия больше любой скидки провайдера. Доступ к системам.

  7. Модель без доступа к 1С, Bitrix, Pimcore или Odoo может только рассуждать.

  8. Через MCP она читает остатки, создаёт заказ, обновляет карточку товара.

  9. Здесь появляется результат, который видно в отчёте. Безопасность.

  10. Дешёвый токен подталкивает пускать в модель больше данных.

  11. Шлюз маскирует персональные данные и коммерческую тайну до выхода во внешний контур и ведёт аудит.

Что это значит для руководителя

  1. Первое: пересчитайте реестр отложенных AI-идей.

  2. Часть из них отвалилась из-за цены, и стоит проверить, какие вернулись в диапазон окупаемости. Второе: не привязывайте себя к одной модели ни контрактом, ни кодом.

  3. По обзору Latent Space, границу цены и качества за один выпуск сдвинули сразу два релиза, и следующий сдвиг придёт скоро. Третье: требуйте от каждого пилота одну метрику, видимую в P&L.

  4. Пилот без неё остаётся театром, и дорого за него платит тот, кто его заказал.

Вердикт

Пятикратное падение цены выгодно тем, кто уже умеет превращать запрос к модели в закрытую задачу. Остальные получат прежний результат, то есть ноль, за меньшие деньги. Сценарий, где пользователь нажимает кнопку и получает готовое, на вид прост, а держится на маршрутизации, контексте, интеграциях и контроле. Эту инженерную часть токен не удешевляет, и от неё зависит, окупится ли проект.

Источник

Latent Space, AINews «not much happened today», выпуск за 1-2 октября 2026: https://www.latent.space/p/ainews-not-much-happened-today-cee. Цены на токены и результат 6,4 пункта приведены по этому обзору. Расчёт стоимости запроса сделан редакцией KT.Team на условном примере.

Обсудить статью: Пятикратное падение цены токена не…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: