Все модели

BAAI

BGE-M3

Многоязычные эмбеддинги BAAI

Текст
Вектор 1024
Тип
Эмбеддинги
Контекст
8K токенов
Русский язык
высокий
Цена
0,8 ₽ / 1M токенов
Размер вектора
1024
Дата выхода
Январь 2024
chat/completions
import OpenAI from "openai"
const client = new OpenAI({
baseURL: "https://api.yenisei.ru/v1",
apiKey: process.env.YENISEI_API_KEY,
})
const stream = await client.chat.completions.create({
model: "bge-m3",
messages: [{ role: "user", content: "Привет!" }],
stream: true,
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "")
}

О модели

BGE-M3 — многоязычная модель эмбеддингов от BAAI, превращающая тексты в векторные представления для семантического поиска и RAG. Её ключевые особенности — широкая многоязычность, поддержка длинного входа и одновременно три режима работы: dense, sparse и multi-vector, — что даёт гибкость под разные конвейеры ретрива. Модель особенно сильна в задачах поиска и RAG, где важно точно сопоставлять запрос и релевантные документы на разных языках. Полученные векторы удобно использовать для кластеризации, рекомендаций, дедупликации и классификации. Уверенно работает с русским и десятками других языков. Практичный выбор, когда нужны качественные эмбеддинги общего назначения с многоязычностью и длинным контекстом.

Сильные стороны

  • Широкая многоязычность и уверенный русский
  • Поддержка длинного входного текста
  • Режимы dense, sparse и multi-vector
  • Высокое качество ретрива в поиске и RAG
  • Векторы для кластеризации и рекомендаций
  • Гибкость под разные конвейеры

Где применить

  • Семантический поиск по документам
  • RAG-конвейеры и вопросно-ответные системы
  • Кластеризация и тематическая группировка
  • Рекомендательные системы
  • Дедупликация и поиск похожего
  • Классификация текстов по векторам