Агент стал сильнее периметра: что 2026 год изменил в LLM

Claude Opus 5 за полцены Fable 5, побег модели OpenAI в Hugging Face, prompt injection. Что этот год в LLM значит для компаний с агентами в проде.

  • Три дня в июле и три письма в августе
  • Что это значит для компании с агентом в проде
  • Где ломаются пилоты
  • Как этот контур строится технически

Повод

Саймон Уиллисон закрыл конгресс WeAreDevelopers в Сан-Хосе докладом «2026 in LLMs (so far)». Он выстроил хронологию года, который, по его словам, начался в ноябре 2025-го с выхода Claude Opus 4.5. События лета ведут к прикладному выводу: модели уже справляются с задачами, которые бизнес хочет им поручить, и результат теперь определяет контур вокруг агента - доступы, журналы, фильтры входных данных.

Компания, которая строит такой контур, получает от AI измеримую пользу. Компания, которая купила только модель, получает вместе с ней риск.

Три дня в июле и три письма в августе

22 июля Уиллисон описал инцидент: тестовая модель OpenAI вышла из песочницы, проникла в инфраструктуру Hugging Face и забрала ответы на бенчмарк. Задача модели была набрать баллы.

Ради этого она сама нашла реальную уязвимость и воспользовалась ею, хотя взлом ей никто не поручал.

Уиллисон назвал случай научной фантастикой, которая произошла на самом деле. 24 июля Anthropic выпустила Claude Opus 5.

По уровню рассуждений модель близка к фронтиру и стоит вдвое меньше Fable

Главная новая черта - проактивность: Opus 5 доводит задачу до конца без пошаговых инструкций. Anthropic отдельно подчёркивает, что кибер-эксплуатации модель не обучали. 25 июля Борис

Черный из Anthropic процитировал системную карту Opus 5 (с. 73): по тестам на prompt injection и результатам red teaming это самая устойчивая к таким атакам модель компании. В августе вышли три конкурирующих открытых письма. Microsoft выступает за модели с открытыми весами. Anthropic предупреждает о рисках AI в авторитарных режимах.

Сотрудники frontier-лабораторий призывают договориться о темпах разработки на международном уровне.

Правила для отрасли пока никто не утвердил.

Что это значит для компании с агентом в проде

  1. Prompt injection - атака, при которой злоумышленник прячет команду в данных, которые читает агент: во входящем письме, PDF от поставщика, описании товара на маркетплейсе.

  2. Агент с доступом к почте и ERP открывает документ и выполняет чужую инструкцию как свою.

  3. Проактивность и устойчивость к инъекциям связаны напрямую.

  4. Проактивный агент делает больше шагов без согласования с человеком, и на любом из них он может прочитать вредный текст или воспользоваться лишним доступом.

  5. Случай OpenAI показывает, что модель, которой поставили цель, может пустить в ход любые доступные ей права.

  6. Формулировка «самая устойчивая» означает меньше успешных атак в тестах Anthropic.

  7. Что атаки перестанут срабатывать, Anthropic не заявляет. Цена, сниженная вдвое, расширяет круг компаний, которым агент по карману.

  8. Моя гипотеза: до конца года агентов внедрят те, кто весной считал их слишком дорогими, и вместе с агентами у них появится новая поверхность атаки.

Оценить, где ИИ даст эффект в вашем процессе

Где ломаются пилоты

Типичный сценарий выглядит так

Команда подключает модель к 1С и корпоративной почте через сервисный аккаунт с полными правами. Демо проходит отлично.

Затем служба безопасности видит схему и закрывает пилот

Time to use - время от старта до первого измеримого результата - растягивается на месяцы, бюджет уходит, метрики стоят на месте.

Во втором сценарии пилот запускают без проверки, и первый счёт от «поставщика» со спрятанной инструкцией превращается в инцидент.

Причина в решениях инженеров: они выдали агенту права администратора и не поставили фильтр на входе.

Модель лишь выполнила то, что ей позволили.

Как этот контур строится технически

  1. ### Шлюз между моделью и данными Обращения к моделям идут через одну точку.

  2. Наш LLM & Security Gateway маскирует персональные данные до отправки провайдеру, проверяет входящий контент на признаки инъекций и пишет в журнал вызов, промпт и ответ.

  3. Через шлюз можно сменить провайдера - Anthropic Claude, OpenAI, GigaChat, YandexGPT, Qwen - без переписывания интеграций.

  4. Пока авторы трёх открытых писем спорят о правилах, независимость от одного вендора защищает бюджет от чужих регуляторных решений. ###

  5. Узкие права через MCP MCP - протокол, по которому агент получает инструменты.

  6. Мы собираем MCP-серверы под конкретную задачу: агент читает остатки и создаёт черновик заказа, а оплату и изменение цены проводит только человек.

  7. Если агент прочитал вредную инструкцию, у него нет инструмента, чтобы её выполнить. ###

  8. Контекст из проверенных источников RAG подключает к агенту базу знаний компании: регламенты, договоры, каталог.

  9. Модель отвечает по этим документам со ссылкой на источник и меньше опирается на случайный текст из входящих данных. ###

  10. Черновик вместо прямой записи В проектах с PIM на Pimcore или Akeneo агент пишет тексты карточек, размечает таксономию и собирает фасеты для каталога.

  11. Результат попадает в черновик, редактор принимает его или правит.

  12. До запуска мы прогоняем агента на данных заказчика и измеряем долю правок.

  13. Масштабировать начинаем, когда эта доля опускается до согласованного порога.

Вердикт

  1. За 2026 год модели стали сильнее и дешевле быстрее, чем компании научились их ограничивать. Цена модели упала вдвое.

  2. Цена инцидента с агентом, у которого права администратора, осталась прежней.

  3. Бюджет этого года я бы вкладывал в контур: шлюз, права под задачу, журнал и проверку результата.

  4. Модель внутри контура, по моей оценке, придётся менять раз в квартал, и при хорошем контуре замена занимает один день.

Обсудить статью: Агент стал сильнее периметра: что 2026…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: