Retrieval поверх корпоративных источников
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
AI-инструменты
Сотрудники тратят до 19–30% рабочего дня на поиск информации, а LLM без доступа к вашим данным выдумывает ответы. RAG-стек KT.
RAG — это не «чат с PDF», а слабосвязанный слой корпоративной памяти: retrieval, векторное хранилище, чанкинг и реранкинг с ответом, заземлённым на источник.
Наши клиенты
Отраслевые решения
Возможности
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
Каждый ответ показывает, из какого документа он взят — ответы проверяемы, а галлюцинации отсекаются на уровне архитектуры, а не уговоров модели.
Семантический поиск по миллионам фрагментов: находит ответ по смыслу, а не по совпадению слов. pgvector — когда данные уже в Postgres, Qdrant — для нагруженного поиска с фильтрами.
Документы режутся на осмысленные фрагменты с метаданными — модель получает «меньше, но точнее» контекста, что напрямую поднимает релевантность и снижает стоимость запроса.
Второй этап переупорядочивает кандидатов по реальной релевантности: recall@10 растёт с 74% до 89%, точность ответов — на 33–40% за ~120 мс. Высокий ROI при минимальной задержке.
Поверх RAG держим кэш заранее проверенных ответов на частые и критичные вопросы — система отдаёт готовый ответ, минуя ретрив, что ещё снижает галлюцинации. Это не llm-wiki: там знание заранее компилируется в выверенную базу и читается без поиска чанков (подход памяти Sloy). RAG и llm-wiki — разные слои и совмещаются.
40–50% рутинных обращений закрываются автоматически с источником в ответе; внутренний ассистент сокращает время поиска регламента с минут до секунд.
Хранилище, retrieval и модель разнесены: можно сменить LLM или векторную БД, не переписывая всё. Решение легко передать между командами и подрядчиками — без vendor-lock.
Метрики precision@K, provenance coverage и hallucination rate встроены в пайплайн — качество ответов измеряется, а не декларируется, и не деградирует молча после изменений.
Подход
Не форкаем и не патчим ядро RAG. RAG остаётся на стандартной обновляемой версии — бизнес-логику выносим в отдельные микросервисы рядом, поэтому обновления платформы не ломают ваши доработки.
Там, где есть зрелое международное решение, используем его, а не изобретаем собственный протокол или платформу. Прежде чем писать код — изучаем, как задача уже решена в индустрии.
Решение слабосвязанное и задокументированное: его можно передать между командами и подрядчиками без переписывания. Вы не привязаны к нам.
Совместимость с AI
RAG-слой подаёт проверенный контекст в модель (GPT, Claude, open-source) — заземляет ответы на ваши данные независимо от того, какую LLM вы используете сегодня и сменили завтра.
Корпоративную базу знаний подключаем к агентам через MCP как стандартный источник: RAG отвечает за «что знаем», MCP — за «как агент это берёт». Оба слоя отчуждаемы.
Retrieval и обращения к модели проходят через шлюз: маршрутизация моделей, бюджеты, observability и обфускация ПДн перед отправкой — корпоративные знания не утекают наружу.
Агенты, которые обслуживают пользователей и вводят данные, опираются на RAG как на источник истины — это превращает «болтливого» ассистента в инструмент, отвечающий по фактам.
Sloy — корпоративная память: знание заранее компилируется в llm-wiki и читается без ретрива («No RAG»). RAG подключается к Sloy вторым слоем — на свежие и редкие факты, которых нет в выверенной базе. Grounding и провенанс работают под несколькими агентами и сценариями.
Проекты