ИИ работает в контуре: чему учат фаззинг, эвалы и политики GitHub

Разбираем кейсы GitHub: почему OSS-Fuzz годами пропускает баги, бенчмарк не гарантирует прод, а Copilot даёт 28 дней на политики. Что строить вокруг LLM.

  • Что произошло
  • На чём компании теряют бюджет
  • Из чего состоит контур
  • Как мы собираем это в KT.Team

Повод

За одну неделю GitHub опубликовал четыре материала, и у них общий вывод: результат ИИ-инструмента зависит от контура вокруг модели. В контур входят проверки на реальных данных, человек, который разбирает ошибки, и правила, по которым новые функции попадают к сотрудникам.

Команда GitHub Security Lab пишет, что проекты годами фаззят код в OSS-Fuzz и всё равно пропускают критические уязвимости, если за процессом никто не следит. Компания, которая покупает ИИ и не строит вокруг него контур, платит за демонстрацию.

Что произошло

Фаззинг с агентом. Фаззинг - метод тестирования: программа получает большой поток искажённых входных данных, а система записывает каждое падение.

Чтобы данные дошли до нужной функции, инженер пишет обвязку (harness).

Покрытие (coverage) показывает, какая доля кода вообще получила входные данные.

Автор из GitHub Security Lab объясняет, почему непрерывный фаззинг ничего не гарантирует: инженер должен следить за покрытием, писать обвязки для кода, до которого фаззер не добрался, и разбирать найденные падения. Taskflow Agent забирает часть этой рутины, а решение по-прежнему принимает человек. Оценка LLM перед продом.

Во втором материале GitHub перечисляет, где ломается модель с хорошим результатом на бенчмарке. В проде пользователи присылают неоднозначные запросы, разметка противоречит сама себе, контекст теряется или обрезается, а реальные данные распределены иначе, чем тестовый набор.

Бенчмарк помогает сравнить модели на прототипе

О поведении системы на живых данных он ничего не сообщает. Copilot включает функции по умолчанию. GitHub ввёл для Copilot Business и Enterprise глобальную политику для новых общедоступных функций. У администраторов есть 28 дней, чтобы выбрать настройку на странице AI Controls.

Если администратор ничего не выберет, пользователи получат функции по политике по умолчанию. Чат как интерфейс.

Автор колонки замечает: ИИ-инструментами массово пользуются три года, а основным интерфейсом к LLM так и осталось текстовое поле.

На чём компании теряют бюджет

Типовой ИИ-пилот идёт так

Команда берёт модель, показывает руководству двадцать удачных примеров на подобранных данных и получает бюджет.

Через три месяца операционисты открывают инструмент раз в неделю, а метрика, ради которой запускали проект, стоит на месте.

Модель в таких историях обычно ни при чём.

Команда не собрала проверочный набор из реальных запросов, не назначила ответственного за разбор ошибок и выкатила новые функции сотрудникам без правил и обучения.

Здесь работает принцип TTU (time to use): ценность инструмента измеряется временем, за которое он выдаёт полезный результат в реальной работе.

Эффектность на демо в эту метрику не входит.

Оценить, где ИИ даст эффект в вашем процессе

Из чего состоит контур

### Проверки на своих данных В проверочный набор берут реальные запросы из вашей системы, включая грязные: неполные карточки, противоречивые справочники, обрезанные документы.

Каждый ответ модели сравнивают с эталоном, который согласовал человек из бизнеса.

После смены модели или промпта набор прогоняют заново, как регрессионные тесты после релиза. ### Человек на исключениях Фаззинг даёт рабочую схему.

Агент берёт на себя объём: покрытие, первичный разбор, черновики обвязок.

Человек разбирает случаи, которые агент пометил как сомнительные.

Эксперт тратит меньше часов и по-прежнему отвечает за результат. ### Управляемое включение

Политику Copilot с окном в 28 дней можно взять за образец для внутренних ИИ-систем.

Администратор сначала решает, какие функции получает каждая группа сотрудников, и только потом функция включается.

Запросы к моделям идут через единую точку, где их логируют и ограничивают. ### Интерфейс под задачу

Чат удобен для исследования и неудобен для потоковой работы

Контент-менеджеру, который ведёт 40 000 товаров, нужны готовые черновики прямо в карточке и кнопки «принять» и «поправить».

Переписка с ботом замедлит его на каждой из этих 40 000 позиций.

Как мы собираем это в KT.Team

  1. В проектах с PIM на Akeneo и Pimcore мы генерируем описания карточек, собираем фасеты фильтров и раскладываем ассортимент по таксономии.

  2. Проверочный набор строим на каталоге клиента и на нём сравниваем модели: Anthropic Claude, OpenAI, YandexGPT, GigaChat, Qwen.

  3. Модель выбираем по качеству на этих данных и по требованиям к размещению.

  4. Запросы к моделям идут через LLM & Security Gateway: он ведёт журнал, применяет политики доступа и маскирует чувствительные данные.

  5. Агенты подключаются к 1С, ERP и шине данных через MCP и получают структурированный контекст из учётных систем.

  6. Копировать текст в чат никому не приходится.

  7. Сюда же относится обновление полей задач в GitHub: MCP-сервер видит приоритет и сроки как отдельные поля, и агент читает их напрямую, без догадок по описанию.

  8. Снаружи результат выглядит просто: в карточке появился нормальный текст, в фильтре - правильные значения.

  9. За ним стоят проверочные наборы, маршрутизация исключений и интеграция с учётными системами.

  10. Эту инженерную работу заказчик обычно не видит.

Вывод

GitHub на собственных инструментах показывает то, что мы видим в проектах: модель - самая дешёвая и самая заменяемая часть ИИ-системы. Деньги компания зарабатывает на контуре вокруг неё: проверках на реальных данных, человеке на исключениях, правилах включения и интерфейсе под конкретную работу. Без такого контура бюджет на ИИ уходит на презентации, а за презентации акционеры никого не благодарят.

Источник

- GitHub Security Lab, «AI-powered fuzzing with the GitHub Security Lab Taskflow Agent», github.blog - GitHub, «How to evaluate LLMs before production», github.blog - GitHub Changelog, «Default Enablement of Copilot Features for Copilot Business and Enterprise», 24.09.2026 - GitHub, «When chat is the wrong UI», github.blog

Обсудить статью: ИИ работает в контуре: чему учат фаззинг,…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: