ЛОКАЛЬНЫЙ ЗАПУСК

Если видеокарты нет: Mac, обычный компьютер, телефон

Одна страница на четыре вопроса — «нейросеть на макбук», «llm на cpu», «локальная нейросеть на телефоне», «на одноплатнике», — потому что вопрос у них один и ответ считается одинаково. Марка машины ни при чём: важны два числа — сколько в ней памяти и как быстро эта память читается.

⚠️ Числа скорости здесь — расчётный потолок, а не замер. Все 84 замера нашего набора сделаны на видеокартах; замеров на процессоре у нас нет ни одного.

Коротко

Модель обязана целиком поместиться в память — это первое ограничение, и оно жёсткое. Второе: чтобы выдать один токен, модель читает все свои веса, поэтому потолок скорости равен пропускной способности памяти, делённой на размер модели. Из этого следует всё остальное: число ядер решает мало, а объём и тип памяти — почти всё. Первая ступень, на которой из нашего каталога поднимается хоть что-то в Q4, — 8 ГБ: 3 модели. ⚠️ Считаем при Q4 — это ходовая разрядность там, где памяти мало.

Сколько у вас памяти — столько и моделей

Своё число памяти вы знаете; таблица переводит его в ответ. Считается при Q4 и контексте 8192 токенов на одного пользователя — то, как модель запускают себе, а не отделу.

Памяти Моделей каталога поместится Самая крупная из них
8 ГБ 3 модели Qwen3-8B8,2 млрд
16 ГБ 6 моделей Mistral Small 3.1 24B Instruct24 млрд
24 ГБ 8 моделей Qwen3-32B32,8 млрд
32 ГБ 8 моделей Qwen3-32B32,8 млрд
64 ГБ 9 моделей Qwen2.5-72B-Instruct72,7 млрд
128 ГБ 9 моделей Qwen2.5-72B-Instruct72,7 млрд

Методология память под модель по снятой архитектуре — как мы считаем. Что исправляли

Потолок скорости на обычной памяти

Считается по одной платформе — Рабочая станция, DDR5-5600, 2 канала, обычный компьютер или младший сервер начального уровня. Полоса выходит 90 ГБ/с, и берём мы 60 % от неё: полной не достаёт ни один движок. Серверные платформы с восемью и двенадцатью каналами — на странице сервера без GPU, там же разобрано, когда видеокарта не нужна вовсе.

Модель Веса в Q4 Потолок Что это значит
T-lite-it-1.0 7,6 млрд 3,8 ГБ 14,1 ток./с Годится для диалога
YandexGPT 5 Lite 8B Pretrain 8 млрд 4 ГБ 13,4 ток./с Годится для диалога
Qwen3-8B 8,2 млрд 4,1 ГБ 13,1 ток./с Годится для диалога
Vikhr-Nemo-12B-Instruct-R 12,2 млрд 6,1 ГБ 8,8 ток./с Терпимо в фоне
GigaChat-20B-A3B-instruct 20,6 млрд 10,3 ГБ 5,2 ток./с Терпимо в фоне
Mistral Small 3.1 24B Instruct 24 млрд 12 ГБ 4,5 ток./с Только пакетные задачи
T-pro-it-1.0 32,8 млрд 16,4 ГБ 3,3 ток./с Только пакетные задачи
Qwen3-32B 32,8 млрд 16,4 ГБ 3,3 ток./с Только пакетные задачи
Qwen2.5-72B-Instruct 72,7 млрд 36,4 ГБ 1,5 ток./с Непригодно
DeepSeek-V3 684,5 млрд 342,3 ГБ 0,2 ток./с Непригодно

⚠️ Это потолок, а не обещание: ниже него бывает, выше — нет. Одновременные пользователи делят ту же память между собой, поэтому два потока не удваивают скорость, а делят её: без ускорителя пакетная обработка спасает куда слабее.

Чего мы про это железо не знаем

  • Пропускную способность памяти Mac, ноутбуков и телефонов. Мы её не наблюдаем и не переписываем из спецификаций производителя, поэтому скорости для этих машин не считаем вовсе. Ограничение по объёму — считаем: оно от марки не зависит.
  • Что дают встроенные ускорители. NPU в телефонах и процессорах, Metal у Apple, движки под одноплатники — всё это меняет картину, и меряем мы этого ничего.
  • Скорость на процессоре по замерам. Замеров без видеокарты у нас нет ни одного из 84: чужие публикации, которые мы разбираем, меряют GPU.
  • Качество ответов после квантования. Считать в Q4 приходится именно там, где памяти мало, — а чем за это платят, мы не измеряем. Подробнее: GGUF и квантование.

Частые вопросы

Работает, и вопрос не в марке машины, а в двух числах: сколько у неё памяти и какая у этой памяти пропускная способность. Первое вы знаете — найдите свою цифру в таблице ступеней выше, ряд начинается с 8 ГБ. Второе мы для конкретных ноутбуков и Mac не наблюдаем и потому не приводим: пропускную способность единой памяти Apple публикует производитель, а мы считаем только то, что снимаем сами или берём из первоисточника со ссылкой.