Подбор GPU под ИИ-модель: сколько нужно VRAM
Оцените, сколько видеопамяти нужно вашей LLM и сколько ускорителей это потребует. Задайте размер модели, режим (инференс или обучение) и разрядность (FP16 / INT8 / INT4) — калькулятор вживую посчитает требуемую VRAM и число карт H100, H200, B200, A100, MI300X, Ascend 910C и других. Точный подбор эксперт пришлёт по запросу.
Калькулятор даёт ориентир, сколько VRAM нужно ИИ-модели и сколько карт это потребует. Память под веса ≈ параметры × байт на параметр (FP16 — 2, INT8 — 1, INT4 — 0,5). Для инференса итог ≈ веса ×1,2 + KV-кэш по контексту; для обучения — ×3–4 (градиенты, Adam, активации). Число карт = требуемая VRAM ÷ память карты, округляя вверх. Это оценка rule-of-thumb, не профилировщик; данные карт — ориентир. Точный подбор — по запросу.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.
Точный подбор GPU под вашу модель
Пришлём точный подбор карт и конфигурации под вашу модель, режим и бюджет — с учётом квантования, аренды и наличия. Цифры выше — ориентир.
Напишите в Telegram — разберём и пришлём расчёт там же.
Как считается требуемая VRAM
Базовая величина — память под веса модели: число параметров, умноженное на количество байт на параметр. В FP16/BF16 это 2 байта, в FP8/INT8 — 1 байт, в INT4 — 0,5 байта, поэтому квантование напрямую снижает требования к памяти. Для инференса к весам добавляется overhead рантайма (~20%) и KV-кэш, который растёт с длиной контекста и числом параллельных запросов (batch). Кэш считается для архитектуры GQA (grouped-query attention) — общие ключи и значения на группу голов внимания: так устроены все актуальные открытые модели, и памяти под кэш им нужно в разы меньше, чем моделям прежнего поколения на полном внимании MHA. Допущение названо здесь намеренно: расчёт по старой схеме завышает требование в разы, а вместе с ним и закупку. Для обучения и дообучения памяти нужно в разы больше: помимо весов в неё попадают градиенты, состояния оптимизатора Adam и активации — ориентир ×3–4 к весам, а полное дообучение с FP32-Adam бывает выше; методы LoRA и QLoRA снижают требования в разы. Число карт вычисляется делением требуемой VRAM на объём памяти конкретного ускорителя с округлением вверх — калькулятор показывает это сразу по нескольким моделям и рекомендует оптимальную конфигурацию: одна карта, узел на 8 GPU или кластер. Все расчёты ориентировочные: фактический расход памяти зависит от движка инференса, длины контекста и числа одновременных запросов, поэтому конфигурацию проверяют на своих числах.
Что дальше
- Данные можно обрабатывать у провайдера — сравните ставки за нужную карту в портале аренды GPU: 33 площадки РФ с открытым рейтингом. Под непостоянную нагрузку это дешевле покупки.
- Данные нельзя выпускать за периметр — тогда вопрос не в цене, а в допустимости: смотрите закрытый ИИ-контур на своём оборудовании и гайд с чего начать.
- Модель маленькая, а пользователей мало — возможно, ускоритель не нужен вовсе: сервер под ИИ без GPU, где считается граница по скорости.
- Считаете покупку — каталог ИИ-ускорителей и калькулятор окупаемости.