Локальная нейросеть: что поднимется на вашей карте
Вопрос «какая видеокарта нужна» задан не с той стороны. С той — «что поднимется на той, что у меня есть или которую я готов купить». Ниже ответ по каждой карте нашего справочника: сколько открытых языковых моделей в неё помещается, какая из них самая крупная и во что карта обходится купить и арендовать.
Считаем по 10 языковым моделям каталога из 12: у остальных не снята архитектура, а без числа слоёв и KV-голов память под контекст не считается — приписать их к поместившимся значило бы занизить ответ молча. Нижняя граница входа среди карт с наблюдаемой ценой — NVIDIA RTX 3090 на 24 ГБ за 277 640 ₽: на ней помещается 4 модели при работе в одиночку и 3 — когда в неё смотрят восемь человек разом. Потолок справочника — NVIDIA B300 на 288 ГБ: 9 моделей из 10. Ни в одну карту справочника не помещается одна модель — DeepSeek-V3: она живёт только на нескольких картах разом. ⚠️ Считается помещение в одну карту: сборка из нескольких — это уже сервер, другой разговор и другие деньги.
Сколько моделей поднимет одна карта
Режим тот же, что на страницах моделей: INT8, контекст 8192 токена. Две колонки различаются только числом одновременных запросов — и это главное, что здесь видно: KV-кэш растёт линейно по числу пользователей, поэтому «хватило коллеге» не значит «хватит отделу».
| Карта | Память | один человек | отдел, 8 запросов разом | Потолок карты | Купить | Аренда, ₽/час |
|---|---|---|---|---|---|---|
| NVIDIA A164 GPU по 16 ГБ GDDR6 ECC на плате; 250 Вт на всю плату; арендуется по одному GPU или долями (vGPU) | 16 ГБ | 3 | 1 | Qwen3-8B 8,2 млрд параметров | 299 536 ₽ наблюдение, 02.09.2026 | — |
| NVIDIA RTX A4000Ampere workstation, GDDR6, однослотовая | 16 ГБ | 3 | 1 | Qwen3-8B 8,2 млрд параметров | 130 000 ₽ оценка редакции | 24–24 |
| NVIDIA L4Ada, GDDR6, однослотовая низкопрофильная | 24 ГБ | 4 | 3 | Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров | по запросу оценка редакции | — |
| NVIDIA RTX 4090Ada, GDDR6X, потребительская | 24 ГБ | 4 | 3 | Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров | 596 130 ₽ наблюдение, 31.08.2026 | 67–100 оценка |
| NVIDIA RTX 3090Ampere, GDDR6X, потребительская | 24 ГБ | 4 | 3 | Vikhr-Nemo-12B-Instruct-R 12,2 млрд параметров | 277 640 ₽ наблюдение, 01.09.2026 | 34–71 |
| NVIDIA RTX 5090Blackwell, GDDR7, потребительская | 32 ГБ | 6 | 4 | Mistral Small 3.1 24B Instruct 24 млрд параметров | 499 990 ₽ наблюдение, 01.09.2026 | 68–230 |
| NVIDIA L40SAda, GDDR6, PCIe | 48 ГБ | 8 | 6 | Qwen3-32B 32,8 млрд параметров | 848 537 ₽ наблюдение, 02.09.2026 | 194–194 |
| RTX 6000 AdaAda Generation workstation/server, GDDR6 ECC | 48 ГБ | 8 | 6 | Qwen3-32B 32,8 млрд параметров | 687 422 ₽ наблюдение, 02.09.2026 | 105–105 |
| Huawei Ascend 910CПрямой ввоз из КНР, HBM | 64 ГБ | 8 | 8 | Qwen3-32B 32,8 млрд параметров | 1 500 000 ₽ оценка редакции | 90–270 оценка |
| NVIDIA H100HBM3, SXM5 | 80 ГБ | 8 | 8 | Qwen3-32B 32,8 млрд параметров | 1 874 859 ₽ наблюдение, 02.09.2026 | 353–686 |
| NVIDIA A100Ampere, HBM2e, SXM4 | 80 ГБ | 8 | 8 | Qwen3-32B 32,8 млрд параметров | 886 698 ₽ наблюдение, 02.09.2026 | 179–223 |
| RTX PRO 6000Blackwell workstation/server, GDDR7 | 96 ГБ | 9 | 8 | Qwen2.5-72B-Instruct 72,7 млрд параметров | 1 999 990 ₽ наблюдение, 01.09.2026 | 133–256 |
| NVIDIA H200HBM3e, SXM5 | 141 ГБ | 9 | 9 | Qwen2.5-72B-Instruct 72,7 млрд параметров | 2 933 604 ₽ наблюдение, 01.09.2026 | 686–686 |
| NVIDIA B200Blackwell, HBM3e | 192 ГБ | 9 | 9 | Qwen2.5-72B-Instruct 72,7 млрд параметров | 5 600 000 ₽ оценка редакции | 1 123–1 123 |
| AMD Instinct MI300XCDNA3, HBM3 | 192 ГБ | 9 | 9 | Qwen2.5-72B-Instruct 72,7 млрд параметров | 2 600 000 ₽ оценка редакции | 150–430 оценка |
| NVIDIA B300Blackwell Ultra, HBM3e | 288 ГБ | 9 | 9 | Qwen2.5-72B-Instruct 72,7 млрд параметров | 6 800 000 ₽ оценка редакции | 1 116–1 116 |
Цена покупки: 10 карт из 16 с наблюдаемой ценой, остальные — оценка редакции, и это помечено в каждой строке. Ставка аренды — рыночный диапазон, разбор в индексе ставок. ⚠️ Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор.
Методология Память считается по снятой архитектуре модели, цена карты — по наблюдению или оценке — как мы считаем. Что исправляли
Чего этот расчёт не говорит
Свои условия: контекст, число запросов, разрядность
В таблице выше профиль один на всех. Здесь можно задать свой и посмотреть, во что он превращает требование к памяти.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.