Gemini 4 Argon: лучшая модель, которой пока нельзя пользоваться

Argon лидирует в 13 из 19 бенчмарков, но доступен лишь в закрытом превью. Как подключать новые модели за день, а не за квартал.

  • Что выпустила Google DeepMind
  • Без доступа TTU не определён
  • На паритет уходит неделя
  • Как это закрывается технически

Повод

  1. Google DeepMind представила Gemini 4 Argon.

  2. Это первая модель Google крупнее класса Flash с февраля, когда вышла Gemini 3.1 Pro.

  3. По подсчёту Latent Space, Argon лидирует в 13 из 19 бенчмарков, которым можно доверять. В экспериментальном режиме модель выдаёт до миллиона токенов за один ответ.

  4. Доступ к ней пока есть только в закрытом превью для задач кибербезопасности.

  5. Отсюда правило для компании, которая строит процессы на AI.

  6. Модель приносит пользу с того дня, когда её подключили к рабочему контуру.

  7. Поэтому архитектура должна позволять подключить новую модель за день.

Что выпустила Google DeepMind

За последние месяцы конкуренты выпустили модели класса Fable и Astra, а Google отвечала только обновлениями Flash. В прошлом месяце в Google DeepMind сменилось руководство.

От Argon ждали, что он закроет отставание, и по бенчмаркам он его закрыл.

Главная техническая новинка - режим Long Decode Continuation. У модели два лимита.

Контекстное окно задаёт, сколько текста модель читает за раз.

Лимит вывода задаёт, сколько она пишет в одном ответе.

Вендоры до сих пор наращивали в основном контекстное окно

Argon поднимает лимит вывода до миллиона токенов, и Latent Space называет это первым таким случаем в индустрии. В миллион токенов помещается модуль кода целиком, полный набор описаний для товарного каталога или документация к системе.

Сроки открытого доступа Google не называет и обещает его «as soon as possible».

Без доступа TTU не определён

Мы в KT.Team оцениваем инструменты по TTU (time to use): сколько времени проходит от появления инструмента до первого результата в процессе клиента. У модели в закрытом превью нет публичной цены, нет SLA и нет условий обработки данных, которые одобрит служба безопасности. Поэтому и TTU у неё нет.

Подключить такую модель к процессу, от которого зависит выручка, нельзя.

Счёт 13 из 19 показывает, на что модель способна в лабораторных условиях.

Руководителю важно другое: улучшится ли его метрика

Например, доля карточек товара, прошедших модерацию с первого раза, или время закрытия заявки.

Бенчмарки Google на этот вопрос не отвечают.

Ответ даёт прогон модели на задачах самой компании.

Оценить, где ИИ даст эффект в вашем процессе

На паритет уходит неделя

На той же неделе прошёл OpenAI DevDay 2026

Latent Space разбирает, как OpenAI выпустила конкурента продукту Jev за одну неделю.

Речь о computer use: модель управляет интерфейсом как человек - открывает окна, заполняет формы, нажимает кнопки.

Ещё недавно эту технологию считали сложной. OpenAI повторила её за семь дней, опираясь на купленную ранее Sky Software.

Для бизнеса это значит, что преимущество отдельной модели измеряется неделями.

За год лидерство несколько раз переходило от одного вендора к другому, и Argon продолжает этот ряд. Компания, которая жёстко привязала процессы к одному API, при каждой смене лидера выбирает из двух плохих вариантов: переписывать интеграцию или оставаться на отставшей модели.

Как это закрывается технически

  1. Инженеры выносят модель в заменяемый слой.

  2. Знания и процессы компании остаются в её собственной инфраструктуре и переживают любую смену вендора. ### Шлюз вместо прямых вызовов

  3. Все запросы к моделям идут через единую точку - у нас это LLM & Security Gateway.

  4. Шлюз маршрутизирует запросы между OpenAI, Anthropic Claude, Google Gemini, GigaChat, YandexGPT и открытыми моделями вроде Qwen и Llama, маскирует персональные данные, логирует расход и качество.

  5. Чтобы перейти на новую модель, команда меняет конфигурацию шлюза.

  6. Код процессов остаётся прежним. ### Инструменты через MCP

  7. Доступ модели к 1С, PIM, ERP и базам данных описывается один раз через MCP.

  8. Любая модель с поддержкой протокола получает те же инструменты.

  9. Знания компании лежат отдельно, в RAG-индексе, и при смене модели их не нужно переносить. ### Свой набор проверок

  10. Компании нужен собственный эталонный набор: 50-200 реальных задач из её процесса с правильными ответами.

  11. Когда выходит новая модель, команда прогоняет её по этому набору и за день видит, сдвинулась ли метрика.

  12. Таблица бенчмарков вендора показывает средний результат на чужих задачах. ### Длинный вывод требует контроля

  13. Миллион токенов на выходе полезен там, где нужен большой объём однотипного текста: описания и атрибуты товаров для Pimcore или Akeneo, миграция кода, документация. В наших PIM-проектах (тексты карточек, разметка таксономии, фасеты для фильтров) больше всего труда уходит на валидацию.

  14. До публикации каждую сгенерированную карточку проверяют на соответствие схеме атрибутов и дереву категорий.

  15. Если такой проверки нет, длинный ответ превращается в гору текста, который никто не прочитал и за качество которого никто не отвечает.

Вердикт

Argon - сильная модель. Мы предполагаем, что в задачах с длинным выводом у неё появится реальное преимущество, но проверить это можно только после открытия доступа. В тот день компании со шлюзом, MCP и собственным набором проверок за сутки узнают, двигает ли Argon их метрики, и подключат его без переписывания кода. Остальные будут изучать таблицы бенчмарков и закладывать интеграцию в план следующего квартала. Бизнес платит за результат в процессе, и скорость подключения новой модели - часть этого результата.

Обсудить статью: Gemini 4 Argon: лучшая модель, которой…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: