Выбор модели
Детальное сравнение вариантов embedding моделей для MCP-серверов.
Сводная таблица
Qwen3-Embedding-4B (LM Studio)
2560
⭐⭐⭐⭐⭐
⭐⭐⭐⭐⭐
GPU 4 ГБ
✅
Qwen3-Embedding-8B (LM Studio)
~4096
⭐⭐⭐⭐⭐
⭐⭐⭐⭐
GPU 8 ГБ
✅
multilingual-e5-large (CPU)
1024
⭐⭐⭐⭐⭐
⭐⭐
4 ГБ RAM
✅
multilingual-e5-base (CPU)
768
⭐⭐⭐⭐
⭐⭐⭐
2 ГБ RAM
✅
multilingual-e5-small (CPU)
384
⭐⭐⭐
⭐⭐⭐⭐⭐
1 ГБ RAM
✅
Рекомендации по сценариям
Сценарий 1: Есть NVIDIA GPU (4+ ГБ)
Рекомендация: LM Studio + Qwen3-Embedding-4B
EMBEDDING_API_BASE=http://host.docker.internal:1234/v1
EMBEDDING_API_KEY=lm-studio
EMBEDDING_MODEL=Qwen3-Embedding-4BПлюсы:
Лучшее качество поиска
Быстрая индексация (минуты)
Отличная поддержка русского языка
Сценарий 2: Есть NVIDIA GPU (8+ ГБ)
Рекомендация: LM Studio + Qwen3-Embedding-8B
Плюсы:
Максимальное качество
Ещё лучше понимает контекст
Сценарий 3: Нет GPU, но есть время
Рекомендация: CPU + multilingual-e5-base
Плюсы:
Не требует GPU
Хороший баланс качество/скорость
Полностью офлайн
Сценарий 4: Нет GPU, нужна скорость
Рекомендация: CPU + multilingual-e5-small
Плюсы:
Самая быстрая на CPU
Минимальные требования
Приемлемое качество
Качество поиска
Что влияет на качество
Размерность вектора — больше = точнее, но медленнее
Обучение модели — Qwen обучен на русском языке
Квантизация — Q8 лучше Q4
Смена модели
При смене embedding модели требуется полная переиндексация всех данных.
Процесс смены модели
Остановите контейнер
Измените переменные окружения
Установите
RESET_DATABASE=trueЗапустите контейнер
Дождитесь переиндексации
Измените
RESET_DATABASE=falseдля следующих запусков
Пример
Автоматическое определение размерности
MCP-серверы автоматически:
Тестируют embedding модель при запуске
Определяют размерность вектора
Сравнивают с существующим индексом
Пересоздают индекс если размерность изменилась
Логи при смене модели
Итоговые рекомендации
GPU 4+ ГБ, хотите лучшее качество
LM Studio + Qwen3-Embedding-4B
GPU 8+ ГБ, нужно максимальное качество
LM Studio + Qwen3-Embedding-8B
Нет GPU, важно качество
CPU + multilingual-e5-base
Нет GPU, важна скорость
CPU + multilingual-e5-small
Для пользователей из России: CPU-модели скачиваются с huggingface.co, который может быть заблокирован. Используйте VPN для первоначального скачивания или выберите LM Studio, где модели скачиваются через встроенный интерфейс приложения.
Last updated