Агентный режим работает циклом
Модель читает задачу, выбирает файл, запускает команду в терминале, смотрит на упавший тест, правит код и начинает заново.
Copilot перешёл на оплату по токенам. Разбираем, почему число шагов агента важнее ума модели и как managed-settings и индекс кода режут счёт.
GitHub добавил в Copilot модель GPT-6.1 Sol от OpenAI. Счёт за неё GitHub выставляет по прейскуранту провайдера в рамках оплаты по потреблению. В июле GitHub также выпустил managed-settings.json и индексацию кодовых баз на C++. Вместе эти релизы превращают AI-разработку в производственную линию со своей себестоимостью. Компания, которая не считает цену закрытой задачи, узнает её из счёта за месяц.
GPT-6.1 Sol доступна всем клиентам на тарифах Copilot Pro+, Max, Business и Enterprise. GitHub предлагает её для агентной разработки и работы в терминале.
По данным ранних тестов GitHub, модель надёжно закрывала задачи и тратила на них заметно меньше токенов и шагов, чем модели семейств GPT-6 и GPT-5.6.
Точных процентов GitHub не приводит, так что эффект на своих задачах компании придётся измерять самим.
Главное в релизе - условия оплаты: модель тарифицируется по прейскуранту провайдера в рамках usage-based billing.
Раньше расходы ограничивала фиксированная цена лицензии на разработчика, теперь такого потолка нет.
Компания платит за каждый токен, который сжёг агент.
Модель читает задачу, выбирает файл, запускает команду в терминале, смотрит на упавший тест, правит код и начинает заново.
На каждой итерации она заново получает накопленный контекст: код, вывод команд, историю своих рассуждений.
Поэтому стоимость задачи растёт примерно как число шагов, умноженное на объём контекста. Возьмём условный пример.
Это наша арифметика, данных GitHub в ней нет.
Задача занимает 40 шагов, на каждом модель получает около 30 тысяч токенов контекста.
Модель, которая решает ту же задачу за 25 шагов, экономит около 40% токенов и столько же времени ожидания. В команде из 30 разработчиков, которые запускают агента десятки раз в день, эта разница появится в бюджете к концу первого месяца.
Отсюда практическая метрика: стоимость одного принятого pull request.
Её легко посчитать, её понимает финансовый директор, и по ней видно, окупает ли дорогая модель свою цену.
Это и есть TTU, time to use: сколько времени и денег проходит от запуска агента до кода, который работает в проде.
С 1 июля в GitHub Enterprise Cloud для всех клиентов доступен managed-settings.json.
Администратор централизованно задаёт, какие модели и плагины разрешены в VS Code и Copilot CLI.
Без такой политики разработчики выбирают модель по вкусу, обычно самую новую и дорогую, и ставят любые плагины.
Плагин с доступом к репозиторию может стать каналом утечки кода, а отвечать за утечку будет руководитель, который этот плагин не видел.
Российские компании часто не могут опереться на Copilot, но задача контроля у них та же. В их стеке GigaChat, YandexGPT, Qwen, Claude и собственные модели, и разработчики подключают их кто как умеет.
Мы в KT.Team закрываем это через LLM & Security Gateway: единую точку, через которую проходят все запросы к моделям.
Шлюз маршрутизирует задачи по классам: автодополнение отправляет в дешёвую модель, рефакторинг легаси - в сильную.
Он держит лимиты по командам, маскирует секреты и персональные данные до отправки наружу и пишет журнал для аудита.
Функционально это аналог managed-settings.json для гетерогенного стека, плюс контроль трафика.
Copilot CLI научился индексировать всю кодовую базу на C++. Microsoft C++ Language Server строит постоянный индекс символов проекта, включая файлы, которые сейчас не открыты.
Без индекса агент на каждый запрос заново ищет, где определена функция и кто её вызывает. В репозитории на миллионы строк на это уходят десятки шагов, и за каждый платит заказчик.
Та же проблема есть в конфигурациях 1С, монолитах на Magento и PHP-системах десятилетней давности.
MCP-серверы отдают ему структуру конфигурации, схемы данных и интеграционные контракты. RAG по коду и документации подставляет нужный фрагмент, и агенту не нужно обходить весь репозиторий.
По нашему опыту AI-native разработки, на таких проектах подготовленный контекст сокращает число шагов сильнее, чем переход на следующую версию модели.
Это гипотеза: универсального бенчмарка на этот счёт пока нет.
- Ввести метрику «стоимость принятого PR»
и считать её по командам и моделям. -
Составить белый список моделей по классам задач и закрепить его политикой через managed-settings.json или шлюз. -
Дать агентам индекс и контекст: язык-серверы, MCP, RAG по документации. -
Поставить лимиты расходов на команду с оповещением при превышении.
Каждый пункт выглядит просто, но работает только при зрелом процессе.
Нужны телеметрия, единая точка доступа к моделям и инженеры, которые умеют связать счёт за токены с результатом в проде.
За три месяца GitHub выпустил всё, что нужно для промышленной AI-разработки: модели с оплатой по потреблению, центральную политику и индекс кода. Выгоднее та модель, которая тратит меньше шагов на задачу. Компании, которые начнут считать стоимость закрытой задачи сейчас, получат от GPT-6.1 Sol экономию. Остальным придётся объяснять финансовому директору счёт, не имея цифр на руках.