Главная/Инструменты/Подбор GPU под ИИ-модель
ИНСТРУМЕНТЫ / ПОДБОР GPU

Подбор GPU под ИИ-модель: сколько нужно VRAM

Оцените, сколько видеопамяти нужно вашей LLM и сколько ускорителей это потребует. Задайте размер модели, режим (инференс или обучение) и разрядность (FP16 / INT8 / INT4) — калькулятор вживую посчитает требуемую VRAM и число карт H100, H200, B200, A100, MI300X, Ascend 910C и других. Точный подбор эксперт пришлёт по запросу.

Коротко

Калькулятор даёт ориентир, сколько VRAM нужно ИИ-модели и сколько карт это потребует. Память под веса ≈ параметры × байт на параметр (FP16 — 2, INT8 — 1, INT4 — 0,5). Для инференса итог ≈ веса ×1,2 + KV-кэш по контексту; для обучения — ×3–4 (градиенты, Adam, активации). Число карт = требуемая VRAM ÷ память карты, округляя вверх. Это оценка rule-of-thumb, не профилировщик; данные карт — ориентир. Точный подбор — по запросу.

Расчёт ориентировочный (rule-of-thumb) — не профилировщик; точный подбор $по запросу в Telegram.

Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.

Требуемая VRAM ≈ 169 ГБ
Память под веса140 ГБ
KV-кэш (инференс)1,3 ГБ
Достаточно одной карты
Сколько карт нужно
NVIDIA H100 80 ГБ
NVIDIA H200 141 ГБ
NVIDIA B200 192 ГБ
NVIDIA B300 288 ГБ
NVIDIA A100 80 ГБ
NVIDIA L40S 48 ГБ
RTX PRO 6000 96 ГБ
RTX 6000 Ada 48 ГБ
AMD Instinct MI300X 192 ГБ
Huawei Ascend 910C 64 ГБ
NVIDIA A16 16 ГБ 11×
NVIDIA L4 24 ГБ
NVIDIA RTX 5090 32 ГБ
NVIDIA RTX 4090 24 ГБ
NVIDIA RTX 3090 24 ГБ
NVIDIA RTX A4000 16 ГБ 11×

Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.

Важно. Расчёт ориентировочный (rule-of-thumb) и не является офертой. Реальная потребность в VRAM зависит от архитектуры модели, движка инференса, длины контекста, метода дообучения (полное / LoRA / QLoRA) и параллелизма. Данные карт (память, TDP) — ориентир, требуют выверки по datasheet. Точный подбор под вашу модель эксперт подтверждает по запросу.
ТОЧНЫЙ ПОДБОР

Точный подбор GPU под вашу модель

Пришлём точный подбор карт и конфигурации под вашу модель, режим и бюджет — с учётом квантования, аренды и наличия. Цифры выше — ориентир.

Напишите в Telegram — разберём и пришлём расчёт там же.

Как считается требуемая VRAM

Базовая величина — память под веса модели: число параметров, умноженное на количество байт на параметр. В FP16/BF16 это 2 байта, в FP8/INT8 — 1 байт, в INT4 — 0,5 байта, поэтому квантование напрямую снижает требования к памяти. Для инференса к весам добавляется overhead рантайма (~20%) и KV-кэш, который растёт с длиной контекста и числом параллельных запросов (batch). Кэш считается для архитектуры GQA (grouped-query attention) — общие ключи и значения на группу голов внимания: так устроены все актуальные открытые модели, и памяти под кэш им нужно в разы меньше, чем моделям прежнего поколения на полном внимании MHA. Допущение названо здесь намеренно: расчёт по старой схеме завышает требование в разы, а вместе с ним и закупку. Для обучения и дообучения памяти нужно в разы больше: помимо весов в неё попадают градиенты, состояния оптимизатора Adam и активации — ориентир ×3–4 к весам, а полное дообучение с FP32-Adam бывает выше; методы LoRA и QLoRA снижают требования в разы. Число карт вычисляется делением требуемой VRAM на объём памяти конкретного ускорителя с округлением вверх — калькулятор показывает это сразу по нескольким моделям и рекомендует оптимальную конфигурацию: одна карта, узел на 8 GPU или кластер. Все расчёты ориентировочные: фактический расход памяти зависит от движка инференса, длины контекста и числа одновременных запросов, поэтому конфигурацию проверяют на своих числах.

Частые вопросы

Ориентир для инференса: память под веса ≈ число параметров × байт на параметр (FP16 — 2, FP8/INT8 — 1, INT4 — 0,5), плюс ~20% overhead и KV-кэш по длине контекста. Например, модель 70B в FP16 — это ~140 ГБ весов, значит нужна не одна карта; в INT4 — ~35 ГБ, помещается в одну H100/H200. Калькулятор считает это вживую.