Новая модель каждый месяц: во что компании вкладывать в AI

Anthropic выпускает сильную модель почти каждый месяц, Opus 5.5 набрал 88,4% в SimpleBench. Что компании строить, чтобы смена модели давала прирост сразу.

  • Что произошло и в каких цифрах
  • Где застревают компании
  • Claude Code как пример архитектуры
  • Что остаётся, когда модель меняется

Повод

Latent Space выпустил разговор с Thariq Shihipar из Anthropic о следующем этапе Claude Code. В подводке редакция перечислила релизы Anthropic за четыре месяца: Sonnet 5 и Fable 5 в июне, Opus 5 в июле, Fable 5.1 в сентябре, Opus 5.5 на этой неделе. Пять моделей за четыре месяца дают руководителю практическое правило: модель в AI-проекте стоит считать сменной деталью.

Ценность накапливается в том, что компания строит вокруг модели:

  • в доступах к данным
  • проверках
  • метриках и процессе
  • который превращает ответ модели в результат

Что произошло и в каких цифрах

  1. По данным Latent Space, годовая выручка Anthropic по подпискам (ARR) составляла $47 млрд на момент крупнейшего раунда в мае. В июле она превысила $65 млрд, к концу 2026 года издание ожидает до $100 млрд.

  2. Там же упоминается целевая оценка IPO в $2 трлн.

  3. Эти цифры взяты из отраслевой подборки, аудиторы их не проверяли.

  4. Масштаб они показывают: компании платят за модели крупные суммы и быстро наращивают расходы. 24-25 сентября AINews зафиксировал волну релизов: Claude Opus 5.5, семейство GPT-6, Gemini 3.8 Flash и Xiaomi MiMo-V2.6-Pro.

  5. По данным AINews, Opus 5.5 возглавил SimpleBench с результатом 88,4%. SimpleBench состоит из вопросов на здравый смысл и пространственную логику: человек решает их легко, модели на них долго ошибались.

  6. Наша гипотеза: рост на таком тесте означает, что агенту можно поручать больше задач с неявными условиями, которые раньше оставались за человеком.

  7. Проверять это стоит на своих задачах.

  8. Сильные модели выходят примерно раз в месяц.

  9. Для внутреннего AI-проекта это означает, что выбранная на старте модель устареет раньше, чем проект дойдёт до прода.

Где застревают компании

Картина, которую мы встречаем у клиентов, выглядит так.

Команда три месяца выбирает модель, готовит сравнительную таблицу и проходит согласование с безопасностью.

Разработчики собирают пилот под конкретную модель: подгоняют промпты под её особенности, пишут интеграции напрямую под её API. К запуску выходят две новые версии, и комитет садится сравнивать заново.

Компания тратит бюджет, бизнес-метрика стоит на месте

Руководитель, который через полгода несёт совету директоров таблицу сравнения моделей вместо цифр по циклу сделки или времени обработки заявки, рискует должностью.

Claude Code как пример архитектуры

Claude Code - агент в терминале разработчика.

Он читает репозиторий, запускает тесты, правит файлы и готовит коммиты.

Инструмент и цикл работы при смене модели остаются прежними.

Когда Anthropic выпускает Opus 5.5, команда получает прирост качества в тот же день и ничего не переписывает.

Команда получает этот прирост, только если выстроила сам цикл:

  • тесты
  • CI
  • права доступа
  • ревью

Без тестов более сильная модель быстрее производит непроверенный код.

Этот цикл мы называем платформой разработки: путь от «написал код» до «работает в проде».

Скорость агента ограничивает именно платформа. Смена модели её не ускоряет.

Оценить, где ИИ даст эффект в вашем процессе

Что остаётся, когда модель меняется

  1. Компания, которая вложилась в четыре слоя ниже, меняет модель настройкой и прогоном теста, без переписывания приложений. ### Контекст

  2. Модель получает данные компании через RAG: поиск по документам, регламентам, 1С, PIM-каталогу.

  3. Качество ответа определяют эти данные, их полнота и актуальность. ###

  4. Инструменты MCP (Model Context Protocol) - открытый стандарт, по которому агент работает с системами: создаёт заказ в 1С, обновляет карточку в Pimcore, находит документ в ЭДО.

  5. Команда пишет коннектор один раз, и он работает с любой моделью, которая поддерживает протокол. ###

  6. Шлюз LLM & Security Gateway стоит между сотрудниками и моделями.

  7. Он маскирует персональные данные, логирует запросы и маршрутизирует их: чувствительные задачи отправляет в GigaChat, YandexGPT или Qwen в контуре компании, сложные рассуждения - в Claude.

  8. Инженер подключает новую модель в шлюзе, приложения работают как раньше. ### Оценка

  9. Набор из 50-100 реальных задач компании с эталонными ответами.

  10. Новую модель прогоняют по нему за вечер, и решение о переходе принимают по цифрам, без комитета.

Как это устроено у нас

  1. Этот материал подготовил наш конвейер news-machine.

  2. Каждое утро он собирает отраслевые источники, отбрасывает устаревшее и недоступное, выделяет сильные сигналы и пишет черновик через Claude.

  3. Дальше работают проверки: гейты качества текста, проверка исходников сайта перед публикацией, режим dry-run по умолчанию и kill-switch, который снимает материал одной командой.

  4. Модель внутри конвейера мы меняем настройкой, проверки и швы между компонентами при этом не трогаем.

  5. Тот же принцип мы применяем в PIM-проектах на Pimcore и Akeneo.

  6. Агент пишет тексты карточек товаров, раскладывает ассортимент по таксономии и заполняет фасеты для фильтров. Контент-менеджер проверяет результат перед публикацией.

  7. Когда выходит модель лучше, мы прогоняем её по эталонным карточкам клиента и переключаем, если цифры выросли.

Вердикт

  1. Ценность AI для бизнеса измеряется временем до пользы (TTU): сколько дней проходит от идеи до сдвинувшейся метрики.

  2. Гонка моделей сокращает это время компаниям, у которых готовы контекст, инструменты, шлюз и собственный тест.

  3. Компании без этих слоёв с каждым релизом возвращаются к сравнительной таблице.

  4. Выбор модели я бы поставил последним пунктом плана: его можно пересматривать ежемесячно, а обвязку вокруг модели компания строит один раз и пользуется ею годами.

Источник

- Claude Code’s Next Era - Thariq Shihipar, Anthropic, Latent Space. - [[AINews] Opus 5.5 is good at explainer videos](https://www.latent.space/p/ainews-opus-55-is-good-at-explainer), Latent Space / AINews.

Обсудить статью: Новая модель каждый месяц: во что…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: