Главная/Гайды/Как запустить LLM локально: сколько нужно памяти и какое железо
ГАЙД · ЛОКАЛЬНЫЙ ИИ

Как запустить LLM локально: сколько нужно памяти и какое железо

Запустить LLM на своём железе реально — вопрос в объёме памяти под модель и в том, готовы ли вы к скорости ниже облачной. Разбираем по-честному: из чего складывается потребность в памяти, на чём это запускать и когда локальный запуск проигрывает аренде.

Автор: Вячеслав Днестранский · обновлено 2026-09-02 · 9 мин чтения
Коротко

Главный ресурс для локального запуска LLM — память под модель, а не скорость. Складывается она из двух частей: веса (число параметров × байт на параметр в выбранной разрядности) и память под контекст, которая растёт по длине диалога и по числу одновременных пользователей. Второй частью обычно пренебрегают — и промахиваются в разы. Чисел в этом гайде нет намеренно: для моделей каталога обе части посчитаны на странице GGUF и квантование, там же названа самая дешёвая карта, в которую модель помещается целиком. Малые модели идут даже на edge-боксе; крупные — на мини-ПК с большой унифицированной памятью или ИИ-станции на 2–4 GPU. Локальный ИИ даёт приватность и работу без облака; для разовой тяжёлой нагрузки честнее аренда мощностей в РФ.

Зачем запускать LLM локально

Локальный запуск — это работа языковой модели на вашем железе, без обращения к облаку. Спрос на него растёт по трём причинам: приватность (данные и промпты не уходят наружу и не попадают в чужие логи), отсутствие абонентской платы за токены и работа офлайн — на объекте, в закрытом контуре, без интернета.

Для бизнеса, вузов и госсектора приватность часто решающий аргумент: во многих организациях облачные ИИ-сервисы запрещены политикой безопасности или недоступны из-за санкционно-платёжного барьера. Локальная модель снимает этот вопрос — данные остаются внутри периметра.

Отдельный сценарий — edge-инференс: обработка прямо на устройстве или на границе сети (видеоаналитика, распознавание, ассистенты на объекте). Здесь важны компактность и энергопотребление, а модель обычно небольшая. Понимание, какой размер модели вам действительно нужен, определяет и требования к железу.

Сколько нужно памяти под LLM

Модель должна поместиться в память целиком — это первое ограничение. Дальше начинается арифметика, и частей в ней две, а не одна: веса — число параметров, умноженное на байты на параметр, и память под контекст (KV-кэш), которая растёт линейно по длине диалога и по числу одновременных пользователей.

Байты на параметр задаёт разрядность: два байта в FP16/BF16, один в FP8/INT8, половина байта в INT4. Квантование — это и есть перевод весов в более грубые числа; память под веса падает кратно. Как эти форматы называются в файлах GGUF и сколько занимает конкретная модель — на странице GGUF и квантование: там для каждой модели каталога стоит вес, полная потребность вместе с памятью под контекст и самая дешёвая карта, в которую она помещается целиком.

⚠️ Ходовое правило «добавьте 10–20 % на контекст» мы проверили и не подтвердили: по характеристикам десяти открытых моделей, снятым 26 августа 2026 года, доля кэша вышла от 1 % до 118 % от веса модели, и в этот диапазон не попала ни одна из десяти — разбор с таблицей. Правило промахивается в обе стороны и на порядок, потому что доля кэша зависит от способа внимания в архитектуре модели, а не от её размера.

Поэтому чисел памяти в этом гайде нет: потребность зависит от модели, разрядности, длины контекста и числа одновременных пользователей, а всё это на портале считается. Где число можно посчитать, мы его не пишем — иначе рядом с расчётом живёт вторая, отстающая копия того же знания.

На каком железе запускать

Железо выбирают под размер модели, которую нужно держать локально. Ключевой дефицит — не столько вычисления, сколько объём быстрой памяти под веса. Отсюда три класса решений:

  1. Малые модели (1–7B) — edge-бокс или мини-ПК начального уровня: боксы на Rockchip RK3588 (Firefly, Radxa), edge-станции Huawei Atlas на Ascend или модули NVIDIA Jetson. Хватает для компьютерного зрения, распознавания и небольших ассистентов при низком энергопотреблении.
  2. Модели до 70B в квантовании — мини-ПК с большой унифицированной памятью. AMD Ryzen AI Max+ 395 даёт до 128 ГБ, делимых между CPU и графикой, и держит 70B там, где обычная видеокарта на 24 ГБ пасует. Скорость генерации ниже дискретного GPU, зато модель целиком в памяти по цене настольного ПК.
  3. Обучение, дообучение и тяжёлый инференс — ИИ-станция на 2–4 профессиональных GPU (RTX PRO 6000, L40S) или настольный суперкомпьютер NVIDIA DGX Spark/Station на Grace Blackwell. Это всё ещё «настольный» класс без инфраструктуры ЦОД, но с полноценным ускорением и стеком CUDA.
  4. Всё перечисленное собрано в категории «Локальный ИИ и мини-ПК» каталога — там карточки с ТТХ, ценовым ориентиром и каналом поставки под каждый класс задач.

Софт для локального запуска

Порог входа в софт низкий. Для одиночного пользователя берут llama.cpp и надстройки над ним — Ollama или LM Studio: они запускают квантованные модели из файлов GGUF на процессоре, дискретной видеокарте или встроенной графике, сами подбирая ускорение. Чем эти две программы различаются и на что выбор между ними влияет — на отдельной странице; коротко: на требования к железу он не влияет никак.

Для многопользовательского инференса и продуктовой нагрузки используют vLLM или TGI — они дают высокую пропускную способность и потоковую выдачу, но требуют дискретных GPU и более тонкой настройки. На китайских ускорителях (Ascend, MetaX, Iluvatar) запуск идёт через их стеки — CANN, MACA, CoreX SDK — с адаптацией под конкретную модель.

Выбор софта вторичен относительно железа: сначала определите размер модели и объём памяти, затем берите инструмент под сценарий. Если дискретной видеокарты нет вовсе — что запустится на обычном компьютере и Mac; если модель нужна под код — кодовые модели с замерами и ценой.

Когда проще арендовать

Локальный запуск не всегда оправдан. Если нагрузка разовая или пиковая — разово прогнать большой датасет, дообучить модель за выходные, протестировать 70B перед закупкой — дешевле арендовать GPU-мощности, чем покупать станцию, которая потом простаивает. Аренда также даёт доступ к картам класса H100/H200, недостижимым для настольного бюджета.

Локальное железо окупается при постоянной приватной работе с моделями, на edge и там, где данные принципиально нельзя отдавать в облако. Разумная стратегия часто гибридная: приватная разработка и инференс — локально, разовое обучение и пиковые задачи — в аренде. Сравнить экономику помогает калькулятор «купить или арендовать» и раздел аренды мощностей в РФ.

Частые вопросы

Точного числа тут нет и быть не может: потребность складывается из весов и памяти под контекст, а вторая часть зависит от длины диалога, числа одновременных пользователей и способа внимания в архитектуре модели. Для моделей каталога это посчитано — на странице GGUF и квантование у каждой стоит вес, полная потребность и самая дешёвая карта, в которую она помещается целиком. Там же видно, что модель такого класса не помещается в обычную видеокарту на 24 ГБ ни в одной из трёх разрядностей — поэтому под неё берут мини-ПК с большой унифицированной памятью или ИИ-станцию на 2–4 GPU.