МОДЕЛЬ / BAAI

BGE-M3

Поиск по корпоративной базе знаний начинается не с языковой модели, а с модели эмбеддингов. Без неё RAG-контур не строится, а в каталогах о ней обычно забывают.

зарубежная веса открыты для поиска по документам
Коротко

Полную потребность в памяти посчитать не можем — не снята архитектура модели. Без числа слоёв и KV-голов память под контекст не считается, а складывать одни веса и называть это ответом — значит занизить его молча. Общий расчёт по числу параметров, с оговоркой что архитектура в нём предполагается, — калькулятор подбора GPU.

Характеристики

Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор. Ревизия 5617a9f61b02. Проверено 02.09.2026.

РазработчикBAAI
Параметрыне опубликовано
Слоёв24
Голов внимания16
KV-голов16
ВниманиеMHA — полное внимание
Контекст8 194 токенов
Память на токен контекста 0,098 МБ
Доступ к весамвеса скачиваются свободно
Первоисточник карточка модели

Во что обходится миллион токенов

Сколько просят за токены этой модели наблюдаемые поставщики. Цена снята с прайса, у неё есть дата и источник.

ЧУЖОЙ API
0,61 ₽
за миллион токенов чтения — самое дешёвое из 3 предложений, у Cloud.ru Foundation Models. Проверено 02.09.2026. Та же модель у Polza AI — 1,19 ₽, дороже в 2 раза.

Вторая половина счёта пустая: полную потребность в памяти по этой модели мы не считаем, а без неё нечего умножать на ставку. Вся картина по токенам — на странице цены миллиона.

Что разрешает лицензия

Нашего разбора этой лицензии по первоисточнику пока нет. В карточке модели заявлено «mit» — это метаданные, а не прочитанный нами текст лицензии, и на них нельзя опираться в корпоративном решении. Разобранные лицензии — здесь.

Сколько памяти нужно этой модели

Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.

Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.

Требуемая VRAM ≈ 169 ГБ
Память под веса140 ГБ
KV-кэш (инференс)1,3 ГБ
Достаточно одной карты
Сколько карт нужно
NVIDIA H100 80 ГБ
NVIDIA H200 141 ГБ
NVIDIA B200 192 ГБ
NVIDIA B300 288 ГБ
NVIDIA A100 80 ГБ
NVIDIA L40S 48 ГБ
RTX PRO 6000 96 ГБ
RTX 6000 Ada 48 ГБ
AMD Instinct MI300X 192 ГБ
Huawei Ascend 910C 64 ГБ
NVIDIA A16 16 ГБ 11×
NVIDIA L4 24 ГБ
NVIDIA RTX 5090 32 ГБ
NVIDIA RTX 4090 24 ГБ
NVIDIA RTX 3090 24 ГБ
NVIDIA RTX A4000 16 ГБ 11×

Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.

Важно. Расчёт ориентировочный (rule-of-thumb) и не является офертой. Реальная потребность в VRAM зависит от архитектуры модели, движка инференса, длины контекста, метода дообучения (полное / LoRA / QLoRA) и параллелизма. Данные карт (память, TDP) — ориентир, требуют выверки по datasheet. Точный подбор под вашу модель эксперт подтверждает по запросу.