Гонка вооружений в AI-безопасности: урок для бизнеса

Anthropic и Hugging Face о гонке кибер- и биобезопасности в AI. Почему защита должна обновляться так же быстро, как атакующие модели.

  • Повод: атака на Hugging Face и ответ индустрии
  • Биобезопасность в одном ряду с кибербезопасностью не случайно
  • Бизнес покупает возможности модели быстрее, чем защиту от них
  • Открытые веса дают защите то, чего нет у закрытых моделей

Повод: атака на Hugging Face и ответ индустрии

На подкасте Latent Space Эрик Нгуен, CEO Radical Numerics, разобрал атаку на инфраструктуру Hugging Face и вопрос, который она подняла в индустрии: что ещё в AI-стеке ломается тем же способом. Anthropic в ответ расширила фильтры Claude на два риска - кибербезопасность и биобезопасность. Клеман Деланг, CEO Hugging Face, сформулировал тезис жёстче: оборонительные возможности в кибербезопасности обязаны быть открытыми и обновляться не медленнее моделей, которые атакуют.

Аргумент подкрепил GLM 5.2 - модель, которую китайская Zhipu AI выложила в открытый доступ бесплатно и которая за месяцы вошла в инфраструктуру тысяч разработчиков по всему миру.

Биобезопасность в одном ряду с кибербезопасностью не случайно

  1. Anthropic классифицирует эти два риска вместе, потому что механизм угрозы одинаковый: модель сжимает годы специализированных знаний в один связный ответ на конкретный вопрос.

  2. Для кибератаки это готовый эксплойт под уязвимость.

  3. Для биобезопасности - синтез знаний, которые раньше требовали профильного образования и доступа к закрытым базам.

  4. Классификаторы Claude режут оба случая одним слоем фильтрации: задача одна - не дать модели выдать инструкцию, применимую во вред, вне зависимости от формулировки вопроса.

Бизнес покупает возможности модели быстрее, чем защиту от них

  1. Компания, которая подключает LLM-агента к внутренним системам, обычно считает скорость и точность ответа, не периметр атаки, который этим открывает.

  2. Атакующая сторона получает доступ к тому же классу моделей, что и защитник, - фронтир доступен обеим сторонам через API или открытые веса.

  3. Защитник обновляет фильтры и политики по циклу релизов продукта, часто раз в квартал.

  4. Разрыв между этими скоростями - узкое место, о котором говорил

  5. Нгуен применительно к атаке на Hugging Face: инфраструктура ломается там, где обновление защиты отстало от обновления атакующей модели.

Оценить, где ИИ даст эффект в вашем процессе

Открытые веса дают защите то, чего нет у закрытых моделей

  1. Тезис Деланга на первый взгляд контринтуитивен: открытые веса вооружают и атакующих.

  2. На практике открытая модель даёт защите тысячи независимых людей, которые ищут в ней уязвимости и патчат форки быстрее, чем один вендор выпускает апдейт. GLM 5.2 стала частью защитной инфраструктуры именно поэтому: сообщество встраивает её в собственные guardrail-пайплайны и адаптирует под конкретную атаку за дни, а не за квартал.

  3. Закрытая модель даёт предсказуемость SLA.

  4. Открытая модель даёт скорость патча.

  5. Для гонки вооружений в безопасности вторая скорость решает исход.

Где это бьёт по инфраструктуре agentic AI прямо сейчас

Компании, которые дают LLM-агентам доступ к инструментам через MCP или строят RAG поверх внутренних документов, открывают тот же класс поверхности атаки, что и модельные вендоры, - только без бюджета Anthropic на классификаторы. Каждый MCP-сервер, который агент может вызвать, и каждый источник в RAG, который он может прочитать, - точка, где модель способна выполнить непроверенную инструкцию или слить данные, если между агентом и системой нет отдельного слоя фильтрации и логирования.

Это слой, который в KT.Team называем LLM & Security Gateway: прокси между агентом и инструментами, который проверяет вызовы, режет то, что не должно уйти наружу, и обновляется отдельно от самого агента - патч-цикл не привязан к релизному циклу продукта.

Вывод

Правило TTU - time to use - работает и для защиты: цена решения измеряется скоростью, с которой оно даёт результат. Guardrail, который патчится месяцами после выхода атакующей модели нового поколения, - театр: создаёт ложное чувство безопасности до первого инцидента.

Бизнес, который подключает AI-агентов к внутренним системам, обязан мерить скорость обновления своей защиты той же линейкой, что и скорость своих фич, - иначе разрыв, который сегодня обсуждают на уровне Anthropic и Hugging Face, откроется у него на уровне одного скомпрометированного MCP-сервера.

Обсудить статью: Гонка вооружений в AI-безопасности: урок…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: