DeepSeek-V3
Крупнейшая открытая MoE-модель в каталоге: считается малая часть весов, а в памяти лежат все. На ней виден главный просчёт при выборе железа под MoE.
Модель на 684,5 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 826 ГБ памяти — это 3× NVIDIA B300. Доступ к весам: веса скачиваются свободно. Лицензия: DeepSeek License Agreement v1.0. Внимание: это MoE-модель — в памяти обязаны лежать все веса, а не только активные. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия e815299b0bcb. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 1 643,2 ГБ 6× NVIDIA B300 | 821,7 ГБ 3× NVIDIA B300 | 411 ГБ 2× NVIDIA B300 |
| Небольшая группа | 8 192 | 4 | 1 645,2 ГБ 6× NVIDIA B300 | 823,7 ГБ 3× NVIDIA B300 | 413 ГБ 2× NVIDIA B300 |
| Отдел, длинные документы | 32 768 | 8 | 1 661,3 ГБ 6× NVIDIA B300 | 839,9 ГБ 3× NVIDIA B300 | 429,1 ГБ 2× NVIDIA B300 |
| Много пользователей, длинный контекст | 32 768 | 32 | 1 716,6 ГБ 6× NVIDIA B300 | 895,1 ГБ 4× NVIDIA B300 | 484,4 ГБ 2× NVIDIA B300 |
Это MoE-модель: считается полный размер весов, потому что в памяти обязаны находиться все эксперты — маршрутизатор выбирает их на лету. Число активных экспертов влияет на скорость, а не на память. KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится миллион токенов
Два счёта рядом: платить за токены чужому поставщику или держать модель на арендованной карте. Обе цифры наши — цену токена мы снимаем с прайсов, ставку аренды с площадок, — и обе с датой. Порог ниже это условие, а не совет: он говорит, при каком объёме счета сравниваются, а не что вам выбрать.
⚠️ Базы НДС у этих двух чисел разные или не названы у одного из них — значит порог показан приблизительно и смещён в сторону API. Приводить их к одной базе домножением мы не будем: там, где режим налогообложения не указан, это была бы догадка. Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
You agree not to use the Model or Derivatives of the Model: … For military use in any way; … For fully automated decision making that adversely impacts an individual’s legal rights
Обязательства по указанию: копия лицензии всем, кому передаёте модель; пометки об изменении файлов
Переносится дальше: ограничения по применению вы обязаны включить в собственные договоры с теми, кому передаёте модель или продукт на её основе.
⚠️ Частое заблуждение: веса DeepSeek считают выложенными под MIT. Под MIT лежит КОД репозитория, а веса модели — под собственным соглашением DeepSeek с ограничениями по применению, и эти ограничения обязаны переноситься во все последующие договоры.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
Самая тяжёлая модель класса «языковая модель» в каталоге
Размер решает, на чём модель поедет: 684,5 млрд параметров — это больше, чем у всех остальных 11 моделей этого класса. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.