Retrieval поверх корпоративных источников
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
AI-инструменты
Сотрудники тратят до 19–30% рабочего дня на поиск информации, а LLM без доступа к вашим данным выдумывает ответы. RAG-стек KT.
RAG — это не «чат с PDF», а слабосвязанный слой корпоративной памяти: retrieval, векторное хранилище, чанкинг и реранкинг с ответом, заземлённым на источник.
Наши клиенты
Отраслевые решения
Возможности
Модель отвечает по вашим документам, вики и базам, а не по «памяти» из интернета — сотрудник получает ответ за секунды вместо часов поиска по 19–30% потерянного дня.
Каждый ответ показывает, из какого документа он взят — ответы проверяемы, а галлюцинации отсекаются на уровне архитектуры, а не уговоров модели.
Семантический поиск по миллионам фрагментов: находит ответ по смыслу, а не по совпадению слов. pgvector — когда данные уже в Postgres, Qdrant — для нагруженного поиска с фильтрами.
Документы режутся на осмысленные фрагменты с метаданными — модель получает «меньше, но точнее» контекста, что напрямую поднимает релевантность и снижает стоимость запроса.
Второй этап переупорядочивает кандидатов по реальной релевантности: recall@10 растёт с 74% до 89%, точность ответов — на 33–40% за ~120 мс. Высокий ROI при минимальной задержке.
Поверх RAG держим кэш заранее проверенных ответов на частые и критичные вопросы — система отдаёт готовый ответ, минуя ретрив, что ещё снижает галлюцинации. Это не llm-wiki: там знание заранее компилируется в выверенную базу и читается без поиска чанков (подход памяти Sloy). RAG и llm-wiki — разные слои и совмещаются.
40–50% рутинных обращений закрываются автоматически с источником в ответе; внутренний ассистент сокращает время поиска регламента с минут до секунд.
Хранилище, retrieval и модель разнесены: можно сменить LLM или векторную БД, не переписывая всё. Решение легко передать между командами и подрядчиками — без vendor-lock.
Метрики precision@K, provenance coverage и hallucination rate встроены в пайплайн — качество ответов измеряется, а не декларируется, и не деградирует молча после изменений.
Подход
Не форкаем и не патчим ядро RAG. RAG остаётся на стандартной обновляемой версии — бизнес-логику выносим в отдельные микросервисы рядом, поэтому обновления платформы не ломают ваши доработки.
Там, где есть зрелое международное решение, используем его, а не изобретаем собственный протокол или платформу. Прежде чем писать код — изучаем, как задача уже решена в индустрии.
Решение слабосвязанное и задокументированное: его можно передать между командами и подрядчиками без переписывания. Вы не привязаны к нам.
Совместимость с AI
RAG-слой подаёт проверенный контекст в модель (GPT, Claude, open-source) — заземляет ответы на ваши данные независимо от того, какую LLM вы используете сегодня и сменили завтра.
Корпоративную базу знаний подключаем к агентам через MCP как стандартный источник: RAG отвечает за «что знаем», MCP — за «как агент это берёт». Оба слоя отчуждаемы.
Retrieval и обращения к модели проходят через шлюз: маршрутизация моделей, бюджеты, observability и обфускация ПДн перед отправкой — корпоративные знания не утекают наружу.
Агенты, которые обслуживают пользователей и вводят данные, опираются на RAG как на источник истины — это превращает «болтливого» ассистента в инструмент, отвечающий по фактам.
Sloy — корпоративная память: знание заранее компилируется в llm-wiki и читается без ретрива («No RAG»). RAG подключается к Sloy вторым слоем — на свежие и редкие факты, которых нет в выверенной базе. Grounding и провенанс работают под несколькими агентами и сценариями.
Новости
8B-модель набрала 78.5% на RTEB и 75.5% на MMTEB Retrieval — первое место в общем зачёте. 1B-вариант даёт 72.4% на RTEB (на 27% меньше ошибок против предыдущей 1B-версии), NVFP4-квантование сохраняет 99%+ точности BF16 при 2x throughput. Веса и рецепты обучения открыты, доступны на Hugging Face.
LightOn-rerank-LW-2B (2B, LoRA-адаптер на Qwen3.5) ранжирует текстовые пассажи и сканы документов одной моделью и одной шкалой — 62.66 NDCG@10 на ViDoRe V3 против 59.18 у Qwen3-VL-Reranker-2B и 59.40 у jina-reranker-m0. 4B-вариант (64.69) обходит Qwen3-VL-Reranker-8B (64.23) вдвое меньшим числом параметров. Веса открыты на Hugging Face.
17M-модель обходит 33M ms-marco-MiniLM-L12-v2 на +0.051 NDCG@10 (MTEB) вдвое меньшим числом параметров; 150M — сильнейший mid-tier reranker до 600M, обходит 596M Qwen3-Reranker-0.6B; 1B повторяет качество 1.54B teacher-модели (разница 0.0001 NDCG@10) при 2.4x более быстром инференсе. Apache 2.0, веса открыты.
4876 пассажей Judicial College of Victoria Criminal Charge Book + 100 экспертных вопросов добавлены в Massive Legal Embedding Benchmark (MLEB, октябрь 2025) — оценка не только retrieval, но и генерации ответа целиком.
Проекты