Главная/Запуск ИИ/Локальная нейросеть
ЛОКАЛЬНЫЙ ЗАПУСК

Локальная нейросеть: что поднимется на вашей карте

Вопрос «какая видеокарта нужна» задан не с той стороны. С той — «что поднимется на той, что у меня есть или которую я готов купить». Ниже ответ по каждой карте нашего справочника: сколько открытых языковых моделей в неё помещается, какая из них самая крупная и во что карта обходится купить и арендовать.

Коротко

Считаем по 10 языковым моделям каталога из 12: у остальных не снята архитектура, а без числа слоёв и KV-голов память под контекст не считается — приписать их к поместившимся значило бы занизить ответ молча. Нижняя граница входа среди карт с наблюдаемой ценой — NVIDIA RTX 3090 на 24 ГБ за 277 640 ₽: на ней помещается 4 модели при работе в одиночку и 3 — когда в неё смотрят восемь человек разом. Потолок справочника — NVIDIA B300 на 288 ГБ: 9 моделей из 10. Ни в одну карту справочника не помещается одна модель — DeepSeek-V3: она живёт только на нескольких картах разом. ⚠️ Считается помещение в одну карту: сборка из нескольких — это уже сервер, другой разговор и другие деньги.

Сколько моделей поднимет одна карта

Режим тот же, что на страницах моделей: INT8, контекст 8192 токена. Две колонки различаются только числом одновременных запросов — и это главное, что здесь видно: KV-кэш растёт линейно по числу пользователей, поэтому «хватило коллеге» не значит «хватит отделу».

Карта Память один человек отдел, 8 запросов разом Потолок карты Купить Аренда, ₽/час
NVIDIA A164 GPU по 16 ГБ GDDR6 ECC на плате; 250 Вт на всю плату; арендуется по одному GPU или долями (vGPU) 16 ГБ 3 1 Qwen3-8B 8,2 млрд параметров 299 536 ₽ наблюдение, 02.09.2026
NVIDIA RTX A4000Ampere workstation, GDDR6, однослотовая 16 ГБ 3 1 Qwen3-8B 8,2 млрд параметров 130 000 ₽ оценка редакции 24–24
NVIDIA L4Ada, GDDR6, однослотовая низкопрофильная 24 ГБ 4 3 Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров по запросу оценка редакции
NVIDIA RTX 4090Ada, GDDR6X, потребительская 24 ГБ 4 3 Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров 596 130 ₽ наблюдение, 31.08.2026 67–100 оценка
NVIDIA RTX 3090Ampere, GDDR6X, потребительская 24 ГБ 4 3 Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров 277 640 ₽ наблюдение, 01.09.2026 34–71
NVIDIA RTX 5090Blackwell, GDDR7, потребительская 32 ГБ 6 4 Mistral Small 3.1 24B Instruct 24 млрд параметров 499 990 ₽ наблюдение, 01.09.2026 68–230
NVIDIA L40SAda, GDDR6, PCIe 48 ГБ 8 6 Qwen3-32B 32,8 млрд параметров 848 537 ₽ наблюдение, 02.09.2026 194–194
RTX 6000 AdaAda Generation workstation/server, GDDR6 ECC 48 ГБ 8 6 Qwen3-32B 32,8 млрд параметров 687 422 ₽ наблюдение, 02.09.2026 105–105
Huawei Ascend 910CПрямой ввоз из КНР, HBM 64 ГБ 8 8 Qwen3-32B 32,8 млрд параметров 1 500 000 ₽ оценка редакции 90–270 оценка
NVIDIA H100HBM3, SXM5 80 ГБ 8 8 Qwen3-32B 32,8 млрд параметров 1 874 859 ₽ наблюдение, 02.09.2026 353–686
NVIDIA A100Ampere, HBM2e, SXM4 80 ГБ 8 8 Qwen3-32B 32,8 млрд параметров 886 698 ₽ наблюдение, 02.09.2026 179–223
RTX PRO 6000Blackwell workstation/server, GDDR7 96 ГБ 9 8 Qwen2.5-72B-Instruct 72,7 млрд параметров 1 999 990 ₽ наблюдение, 01.09.2026 133–256
NVIDIA H200HBM3e, SXM5 141 ГБ 9 9 Qwen2.5-72B-Instruct 72,7 млрд параметров 2 933 604 ₽ наблюдение, 01.09.2026 686–686
NVIDIA B200Blackwell, HBM3e 192 ГБ 9 9 Qwen2.5-72B-Instruct 72,7 млрд параметров 5 600 000 ₽ оценка редакции 1 123–1 123
AMD Instinct MI300XCDNA3, HBM3 192 ГБ 9 9 Qwen2.5-72B-Instruct 72,7 млрд параметров 2 600 000 ₽ оценка редакции 150–430 оценка
NVIDIA B300Blackwell Ultra, HBM3e 288 ГБ 9 9 Qwen2.5-72B-Instruct 72,7 млрд параметров 6 800 000 ₽ оценка редакции 1 116–1 116

Цена покупки: 10 карт из 16 с наблюдаемой ценой, остальные — оценка редакции, и это помечено в каждой строке. Ставка аренды — рыночный диапазон, разбор в индексе ставок. ⚠️ Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор.

Методология Память считается по снятой архитектуре модели, цена карты — по наблюдению или оценке — как мы считаем. Что исправляли

Чего этот расчёт не говорит

Помещается — не значит быстро. Здесь считается только память. Сколько токенов в секунду карта выдаст, зависит от модели, длины запроса и числа пользователей; своих замеров мы не проводим, чужие опубликованные с условиями и датами лежат на странице цены миллиона токенов.
INT4 экономит память и тратит качество. Вдвое меньше под веса — но потери на длинном контексте и на русском больше, чем в англоязычных замерах, а KV-кэш почти никогда не квантуется вместе с весами. Поэтому в таблице INT8.
Скачать веса и иметь право их применять — разные вещи. У части моделей в лицензии стоит порог или перенос ограничений в ваши договоры. Разбор по первоисточникам — лицензии открытых LLM.
Проверить дешевле, чем купить. Пока непонятно, какая модель решает вашу задачу, покупка фиксирует выбор железом. Арендованная карта отвечает на тот же вопрос за дни.

Свои условия: контекст, число запросов, разрядность

В таблице выше профиль один на всех. Здесь можно задать свой и посмотреть, во что он превращает требование к памяти.

Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.

Требуемая VRAM ≈ 169 ГБ
Память под веса140 ГБ
KV-кэш (инференс)1,3 ГБ
Достаточно одной карты
Сколько карт нужно
NVIDIA H100 80 ГБ
NVIDIA H200 141 ГБ
NVIDIA B200 192 ГБ
NVIDIA B300 288 ГБ
NVIDIA A100 80 ГБ
NVIDIA L40S 48 ГБ
RTX PRO 6000 96 ГБ
RTX 6000 Ada 48 ГБ
AMD Instinct MI300X 192 ГБ
Huawei Ascend 910C 64 ГБ
NVIDIA A16 16 ГБ 11×
NVIDIA L4 24 ГБ
NVIDIA RTX 5090 32 ГБ
NVIDIA RTX 4090 24 ГБ
NVIDIA RTX 3090 24 ГБ
NVIDIA RTX A4000 16 ГБ 11×

Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.

Важно. Расчёт ориентировочный (rule-of-thumb) и не является офертой. Реальная потребность в VRAM зависит от архитектуры модели, движка инференса, длины контекста, метода дообучения (полное / LoRA / QLoRA) и параллелизма. Данные карт (память, TDP) — ориентир, требуют выверки по datasheet. Точный подбор под вашу модель эксперт подтверждает по запросу.

Частые вопросы

Зависит от того, какую модель вы поднимаете и сколько человек в неё смотрит. Самая дешёвая карта с наблюдаемой ценой, на которой в нашем каталоге поднимается хотя бы одна языковая модель, — NVIDIA RTX 3090 (24 ГБ, 277 640 ₽). На ней помещается 4 модели при работе в одиночку и 3 — когда в неё смотрят восемь человек разом. Это не рекомендация, а нижняя граница: выше по таблице карт больше памяти и больше моделей.