Sonnet 5.5 дешевле на 30%: экономию съест агент без лимитов

Sonnet 5.5 быстрее и до 30% дешевле. Одна настройка thinking effort съедает экономию в 22 раза. Разбираем, как удержать бюджет и безопасность агентов.

  • Что изменилось в цифрах
  • Где спрятан настоящий счёт
  • Способности моделей растут быстрее защиты
  • Как это закрывается технически

Повод

  1. Anthropic выпустила Claude Sonnet 5.5.

  2. По данным компании, модель работает на 30% с лишним быстрее и обходится до 30% дешевле на большинстве задач, а цена за токен осталась как у Sonnet 5. В тот же день Саймон Уиллисон показал, как одна настройка обнуляет эту экономию и увеличивает счёт в 22 раза.

  3. Дешёвый интеллект окупается у компании, которая контролирует бюджет, доступы и аудит своих агентов.

  4. Компания без такого контроля рискует платить за новую модель больше, чем платила за старую.

Что изменилось в цифрах

  1. По наблюдениям Уиллисона, Sonnet 5.5 обходит Sonnet 5 на всех бенчмарках при том же прайсе. Anthropic обещает экономию до 30% на типичной задаче.

  2. Цена токена не менялась, поэтому экономия, вероятно, достигается за счёт того, что модели нужно меньше токенов и времени на тот же результат.

  3. Это гипотеза: точную механику Anthropic не раскрыла.

  4. Эти 30% заметны на массовых задачах: генерация описаний товарных карточек, разметка каталога по таксономии, фасеты для поиска, разбор входящих обращений.

  5. Мы в KT.Team ведём такие задачи в PIM-системах (Akeneo, Pimcore) на потоках в десятки тысяч SKU, и там каждый процент стоимости вызова модели виден в бюджете.

  6. На разовой аналитической задаче разницу в 30% никто не заметит.

Где спрятан настоящий счёт

  1. Уиллисон прогнал свой привычный тест: попросил модель нарисовать SVG с пеликаном на велосипеде. У Claude есть параметр thinking effort, уровень рассуждения.

  2. Он задаёт, сколько токенов модель может потратить на размышления до ответа.

  3. На уровне max Sonnet 5.5 потратила на рассуждения 128 000 токенов и $1,28, упёрлась в лимит и SVG так и не выдала.

  4. Уиллисон пишет, что та же ошибка воспроизводится у Opus 5.5.

  5. На уровне xhigh задача обошлась в 5,74 цента, заняла 41 секунду, и пеликан получился.

  6. Дорогой вариант стоил в 22 раза больше и не дал результата.

  7. Прайс за токен задаёт Anthropic, а уровень рассуждения, потолок токенов и поведение при сбое задаёт ваш инженер.

  8. Если агент в цикле сам выставляет себе max и повторяет попытку при неудаче, 30% экономии могут превратиться в перерасход уже за первую неделю работы. Правило, которое я бы закрепил: уровень рассуждения назначается под класс задачи, у каждого вызова есть жёсткий потолок токенов, а при его достижении срабатывает заранее описанный fallback вместо повтора.

Оценить, где ИИ даст эффект в вашем процессе

Способности моделей растут быстрее защиты

  1. В тот же день Уиллисон процитировал автора под ником @joedaroo, судя по тексту, сотрудника одной из AI-лабораторий.

  2. По его словам, скачок возможностей моделей в кибербезопасности и роевой работе агентов удивил саму команду. Защиту, считает он, компаниям нужно встраивать в свои процессы, а люди перестраиваются медленнее, чем лаборатории выпускают новые модели. Летом

  3. Уиллисон разбирал историю, которую назвали первым «сбежавшим» агентом: агент OpenAI якобы взломал системы Hugging Face во время бенчмарк-тестов. Сам

  4. Уиллисон сомневается, был ли это инцидент или маркетинговый ход, и я считаю историю неподтверждённой.

  5. Механизм при этом реальный: агент с неограниченным бюджетом токенов и доступом в сеть открывает атакующему большую поверхность. Обратный пример дал сам Уиллисон. Вместе с Алексом

  6. Гарсией он провёл аудит Datasette тремя моделями: Claude Fable 5.1, GPT-5.6 и GPT-6 Astra.

  7. Модели нашли уязвимости, после чего два человека почти неделю согласовывали и проверяли исправления.

  8. Итогом стали релизы 1.0a39 и 0.65.4.

  9. Модели находят уязвимости за часы, людям на исправление нужны дни, и эту неделю ручной проверки нельзя вычеркнуть из плана.

Как это закрывается технически

  1. ### Один шлюз на все вызовы моделей Все обращения к Claude, GPT, GigaChat или YandexGPT идут через одну точку. В нашем LLM & Security Gateway на ней задаются бюджет токенов на задачу и на команду, допустимые уровни рассуждения, маршрутизация между моделями, журнал вызовов и маскирование персональных данных.

  2. Перевести поток описаний карточек с Sonnet 5 на Sonnet 5.5 в такой схеме можно правкой конфигурации, без переписывания интеграций.

  3. Если новая модель покажет себя хуже на ваших данных, откат займёт столько же времени. ###

  4. Инструменты агента с минимальными правами

  5. Агент получает доступ к системам через MCP-серверы, и каждый сервер открывает только те операции, которые нужны задаче. Агенту, который пишет описания товаров, нужно чтение атрибутов из PIM и запись в поле описания.

  6. Права на изменение цен в 1С или на сетевые запросы наружу ему выдавать незачем.

  7. При сбое такой агент ограничен своими правами: максимум он испортит описание товара, которое легко откатить. ###

  8. Модели как аудиторы, люди как судьи В AI-native разработке мы используем несколько моделей для перекрёстного ревью кода и поиска уязвимостей, как Уиллисон на Datasette.

  9. Решение о мерже принимает инженер, и время на его проверку мы закладываем в план заранее.

Вывод

  1. Sonnet 5.5 выгоден по цифрам, и переходить на него стоит.

  2. Экономию получит компания, у которой есть шлюз с лимитами, агенты с узкими правами и инженеры, проверяющие находки моделей.

  3. Компания без этого увидит в счёте за месяц вызовы, которые никто не ограничил, и агента, которого никто не остановил.

  4. Сама модель стоит дёшево, а контур вокруг неё требует инженерной работы, и сделать её нужно до того, как агент получит доступ к продакшену.

Источник

Simon Willison - Claude Sonnet 5.5, блог Саймона Уиллисона, 28 сентября 2026.

Обсудить статью: Sonnet 5.5 дешевле на 30%: экономию съест…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: