Новости RAG

Здесь только свежие релизы — примерно за последние 12 месяцев, а не весь исторический архив. Поэтому у давно существующего продукта может быть всего несколько новостей.

4 новостей

RAG
Papers with Code: гибридный поиск на 110k+ статей через HF Inference/Jobs/Buckets

Продакшн-пример RAG-инфры: PostgreSQL full-text + семантика на Qwen3-Embedding-0.6B (256-мерные Matryoshka-векторы), эмбеддинг корпуса батчами на HF Jobs (L4, ~75 статей/сек), Storage Buckets как версионированный слой между compute и БД, объединение через Reciprocal Rank Fusion с fallback на lexical-only при таймауте.

здесь батч-джобы вместо стриминга — офлайн-переиндексация, не realtime pipeline Apache Kafka →
RAG
Sentence Transformers v6.0: multi-vector (late interaction) энкодеры

Новый класс MultiVectorEncoder — ColBERT-подобный late interaction поверх dense/sparse моделей уже в библиотеке. Точнее на нюансах (токен-в-токен MaxSim вместо сжатия в один вектор), но индекс на порядки тяжелее: 311.5 МБ vs 7.5 МБ dense на 4874 пассажах Natural Questions. 40+ открытых чекпойнтов (LateOn, mLateOn, ColBERT, ColPali) на HF Hub.

RAG
Sentence Transformers v5.4: мультимодальные эмбеддинги и реранкеры

Единый API для энкодинга и сравнения текста, изображений, аудио и видео одной моделью; реранкеры тоже стали мультимодальными (Qwen3-VL, BAAI BGE-VL, NVIDIA Nemotron — все открытые веса). Паттерн retrieve-and-rerank теперь работает поверх смешанного контента — база под RAG по визуальным документам и скриншотам, а не только тексту.

RAG
EmbeddingGemma: компактная embedding-модель Google для RAG

EmbeddingGemma-300M (открытые веса, Apache 2.0) — топ MTEB multilingual среди моделей до 500M, контекст 2048 токенов, Matryoshka-эмбеддинги с усечением с 768 измерений. На медицинском домене файнтюн обошёл более крупный Qwen3-Embedding-0.6B: 0.8862 против 0.8493 NDCG@10.

Обсудить Новости RAG

Укажите email или телефон, чтобы мы могли вам ответить.

Отправить через: