BGE-M3
Поиск по корпоративной базе знаний начинается не с языковой модели, а с модели эмбеддингов. Без неё RAG-контур не строится, а в каталогах о ней обычно забывают.
Полную потребность в памяти посчитать не можем — не снята архитектура модели. Без числа слоёв и KV-голов память под контекст не считается, а складывать одни веса и называть это ответом — значит занизить его молча. Общий расчёт по числу параметров, с оговоркой что архитектура в нём предполагается, — калькулятор подбора GPU.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия 5617a9f61b02. Проверено 02.09.2026.
Во что обходится миллион токенов
Сколько просят за токены этой модели наблюдаемые поставщики. Цена снята с прайса, у неё есть дата и источник.
Вторая половина счёта пустая: полную потребность в памяти по этой модели мы не считаем, а без неё нечего умножать на ставку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
Нашего разбора этой лицензии по первоисточнику пока нет. В карточке модели заявлено «mit» — это метаданные, а не прочитанный нами текст лицензии, и на них нельзя опираться в корпоративном решении. Разобранные лицензии — здесь.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.