Где думает модель: зачем AWS поселила Claude в Индии и Сеуле

AWS открыла Claude с обработкой данных внутри Индии, Кореи и Сингапура. Как решить ту же задачу в России по 152-ФЗ с помощью LLM-шлюза и маршрутизации.

  • Что именно запустила AWS
  • Почему регион важнее новой модели
  • Как это выглядит в России
  • Как это закрывается технически

Повод

AWS за месяц открыла в Amazon Bedrock доступ к Claude с обработкой данных внутри страны. В Индии доступны Opus 5, Sonnet 5 и Haiku 4.5, в Сеуле - Opus 5 и Sonnet 5, в Сингапуре - Sonnet 5.

Российской компании Bedrock не пригодится, но вывод из этих релизов касается её напрямую. Место, где модель обрабатывает данные, стало параметром архитектуры того же уровня, что и выбор базы данных. Его стоит определить до пилота, пока служба безопасности ещё не написала своё письмо.

Что именно запустила AWS

Инференс - это обработка запроса моделью: текст уходит на сервер, модель считает ответ и возвращает его. Bedrock распределяет запросы через профили cross-Region inference: сервис раскидывает нагрузку между несколькими дата-центрами, чтобы выдержать пики.

Глобальный профиль может отправить запрос в любой регион мира. Для

Индии AWS сделала географический профиль: запросы обрабатываются только в Мумбаи и Хайдарабаде. В Сеуле и

Сингапуре AWS ограничила обработку ещё жёстче:

  • по её словам
  • запрос обрабатывается в том регионе
  • куда его отправили
  • и за его пределы не выходит

Целевую аудиторию AWS называет прямо: финансы, здравоохранение, госсектор.

По нашим наблюдениям, компании из этих отраслей последние годы держали LLM в песочнице и не выводили их в прод, потому что юристы не подписывали трансграничную передачу данных. В те же недели AWS добавила в каталог Grok 4.7 от xAI: контекст 500 тыс. токенов и четыре уровня «усилия рассуждения», от low до xhigh.

Он доступен только через cross-Region профили

AWS добавляет модели в каталог быстрее, чем юристы заказчика успевают согласовать хотя бы одну.

Почему регион важнее новой модели

  1. В регулируемой компании пилот на обезличенных данных обычно проходит успешно.

  2. Затем служба безопасности спрашивает, в какой стране обрабатывается запрос, и проект встаёт на месяцы.

  3. На наших интеграционных проектах согласование доступа к данным часто занимает больше времени, чем разработка.

  4. Это наблюдение по нашей практике, отраслевой статистики по нему нет.

  5. Мы измеряем ценность ИИ через TTU - time to use: время от идеи до первого реального документа, который модель обработала в проде. AWS сокращает самый долгий отрезок этого пути: переносит вычисления туда, где их разрешает регулятор. Качество модели остаётся прежним.

  6. Меняется юридический статус: её разрешено применять на реальных данных.

Как это выглядит в России

152-ФЗ требует собирать и хранить персональные данные граждан РФ в базах на территории страны. О трансграничной передаче нужно уведомлять Роскомнадзор, а в ряд стран передача ограничена. К этому добавляются банковская и коммерческая тайна и внутренние политики. Claude, OpenAI и Gemini работают на зарубежных серверах.

Внутри контура доступны GigaChat, YandexGPT и открытые модели - Qwen и Llama на собственных GPU.

Компании обычно ошибаются одним из двух способов

Первый: руководство запрещает внешние модели целиком и мирится с заметно худшим качеством на сложных задачах. Второй: руководство ничего официально не запрещает, и сотрудники вставляют договоры в чат-бот с личного аккаунта.

Во втором случае данные уходят за рубеж, и в журналах компании об этом нет ни строки.

Оценить, где ИИ даст эффект в вашем процессе

Как это закрывается технически

AWS решает задачу географией

Внутри одной компании ту же логику реализует шлюз. В LLM & Security Gateway мы собираем все обращения к моделям в одну точку входа: 1. Классификация.

Шлюз определяет, есть ли в запросе персональные данные, реквизиты, коммерческая тайна. 2. Маскирование. ФИО, телефоны, ИНН и номера счетов заменяются токенами до отправки и подставляются обратно в ответ. 3. Маршрутизация.

Чувствительный запрос уходит в модель внутри контура - Qwen on-prem или GigaChat.

Обезличенный или публичный запрос уходит в сильную глобальную модель, например Anthropic Claude. 4. Журнал.

Шлюз записывает, кто отправил запрос, в какую модель и с какой категорией данных.

Аудитор получает ответ за минуту, без расследования.

Приложения работают со шлюзом через один API.

Чтобы сменить модель или правило маршрутизации, инженер меняет конфигурацию, код приложений остаётся прежним.

Новую версию GigaChat или Qwen в такой схеме можно подключить за день.

Пример: договоры

В ещё одном материале AWS описывает директора по закупкам, у которого сотни или тысячи договоров с поставщиками.

Чат-бот справляется с одним PDF. На вопросы по всей базе - «на какого поставщика мы тратим больше всего»

, «какие договоры истекают в этом квартале» - он ответить не может: для этого данные нужно сначала извлечь в структуру. В российской компании договоры приходят через ЭДО и учитываются в 1С. Рабочий контур выглядит так. Документ из ЭДО попадает к локальной модели, потому что в нём реквизиты и персональные данные. Модель извлекает сумму, сроки, стороны и статус подписания и записывает поля в 1С или в хранилище. Аналитические вопросы получают ответ из таблицы, поиск по формулировкам пунктов работает через RAG.

Сложный юридический разбор, если он нужен, выполняет внешняя модель, и только по обезличенному тексту. Интеграцию ЭДО с 1С и шину для такого потока мы строим давно; модель в этой схеме - ещё один участник процесса со своими правами доступа.

Вердикт

За месяц AWS добавила в Bedrock новые регионы и модель другого вендора. Мы ожидаем, что темп сохранится. Архитектуру, завязанную на одного провайдера, придётся переделывать при каждом таком обновлении. Если место обработки и выбор модели настраиваются на шлюзе, смена каталога сводится к правке конфигурации. Компания, которая до пилота решила, где будут обрабатываться данные, снимает главный риск задержки выхода в прод.

Компания, которая откладывает этот вопрос, платит за пилот, который потом месяцами ждёт согласования.

Источник

Обсудить статью: Где думает модель: зачем AWS поселила…

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: