Retrieval поверх корпоративных источников
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
AI-инструменты
Сотрудники тратят до 19–30% рабочего дня на поиск информации, а LLM без доступа к вашим данным выдумывает ответы. RAG-стек KT.
RAG — это не «чат с PDF», а слабосвязанный слой корпоративной памяти: retrieval, векторное хранилище, чанкинг и реранкинг с ответом, заземлённым на источник.
Наши клиенты
Отраслевые решения
Возможности
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
Каждый ответ показывает, из какого документа он взят — ответы проверяемы, а галлюцинации отсекаются на уровне архитектуры, а не уговоров модели.
Семантический поиск по миллионам фрагментов: находит ответ по смыслу, а не по совпадению слов. pgvector — когда данные уже в Postgres, Qdrant — для нагруженного поиска с фильтрами.
Документы режутся на осмысленные фрагменты с метаданными — модель получает «меньше, но точнее» контекста, что напрямую поднимает релевантность и снижает стоимость запроса.
Второй этап переупорядочивает кандидатов по реальной релевантности: recall@10 растёт с 74% до 89%, точность ответов — на 33–40% за ~120 мс. Высокий ROI при минимальной задержке.
Поверх RAG держим кэш заранее проверенных ответов на частые и критичные вопросы — система отдаёт готовый ответ, минуя ретрив, что ещё снижает галлюцинации. Это не llm-wiki: там знание заранее компилируется в выверенную базу и читается без поиска чанков (подход памяти Sloy). RAG и llm-wiki — разные слои и совмещаются.
40–50% рутинных обращений закрываются автоматически с источником в ответе; внутренний ассистент сокращает время поиска регламента с минут до секунд.
Хранилище, retrieval и модель разнесены: можно сменить LLM или векторную БД, не переписывая всё. Решение легко передать между командами и подрядчиками — без vendor-lock.
Метрики precision@K, provenance coverage и hallucination rate встроены в пайплайн — качество ответов измеряется, а не декларируется, и не деградирует молча после изменений.
Подход
Не форкаем и не патчим ядро RAG. RAG остаётся на стандартной обновляемой версии — доработки выносим в отдельные модули или сервисы. Перед обновлением проверяем совместимость модулей и интеграций на тестовом контуре.
Там, где есть зрелое международное решение, используем его, а не изобретаем собственный протокол или платформу. Прежде чем писать код — изучаем, как задача уже решена в индустрии.
Решение слабосвязанное и задокументированное: его можно передать между командами и подрядчиками без переписывания. Вы не привязаны к нам.
Совместимость с AI
RAG-слой подаёт проверенный контекст в модель (GPT, Claude, open-source) — заземляет ответы на ваши данные независимо от того, какую LLM вы используете сегодня и сменили завтра.
Корпоративную базу знаний подключаем к агентам через MCP как стандартный источник: RAG отвечает за «что знаем», MCP — за «как агент это берёт». Оба слоя отчуждаемы.
Retrieval и обращения к модели проходят через шлюз: маршрутизация моделей, бюджеты, observability и обфускация ПДн перед отправкой — корпоративные знания не утекают наружу.
Агенты, которые обслуживают пользователей и вводят данные, опираются на RAG как на источник истины — это превращает «болтливого» ассистента в инструмент, отвечающий по фактам.
Sloy — корпоративная память: знание заранее компилируется в llm-wiki и читается без ретрива («No RAG»). RAG подключается к Sloy вторым слоем — на свежие и редкие факты, которых нет в выверенной базе. Grounding и провенанс работают под несколькими агентами и сценариями.
Новости
Продакшн-пример RAG-инфры: PostgreSQL full-text + семантика на Qwen3-Embedding-0.6B (256-мерные Matryoshka-векторы), эмбеддинг корпуса батчами на HF Jobs (L4, ~75 статей/сек), Storage Buckets как версионированный слой между compute и БД, объединение через Reciprocal Rank Fusion с fallback на lexical-only при таймауте.
Новый класс MultiVectorEncoder — ColBERT-подобный late interaction поверх dense/sparse моделей уже в библиотеке. Точнее на нюансах (токен-в-токен MaxSim вместо сжатия в один вектор), но индекс на порядки тяжелее: 311.5 МБ vs 7.5 МБ dense на 4874 пассажах Natural Questions. 40+ открытых чекпойнтов (LateOn, mLateOn, ColBERT, ColPali) на HF Hub.
Единый API для энкодинга и сравнения текста, изображений, аудио и видео одной моделью; реранкеры тоже стали мультимодальными (Qwen3-VL, BAAI BGE-VL, NVIDIA Nemotron — все открытые веса). Паттерн retrieve-and-rerank теперь работает поверх смешанного контента — база под RAG по визуальным документам и скриншотам, а не только тексту.
EmbeddingGemma-300M (открытые веса, Apache 2.0) — топ MTEB multilingual среди моделей до 500M, контекст 2048 токенов, Matryoshka-эмбеддинги с усечением с 768 измерений. На медицинском домене файнтюн обошёл более крупный Qwen3-Embedding-0.6B: 0.8862 против 0.8493 NDCG@10.
Проекты