Если видеокарты нет: Mac, обычный компьютер, телефон
Одна страница на четыре вопроса — «нейросеть на макбук», «llm на cpu», «локальная нейросеть на телефоне», «на одноплатнике», — потому что вопрос у них один и ответ считается одинаково. Марка машины ни при чём: важны два числа — сколько в ней памяти и как быстро эта память читается.
⚠️ Числа скорости здесь — расчётный потолок, а не замер. Все 84 замера нашего набора сделаны на видеокартах; замеров на процессоре у нас нет ни одного.
Модель обязана целиком поместиться в память — это первое ограничение, и оно жёсткое. Второе: чтобы выдать один токен, модель читает все свои веса, поэтому потолок скорости равен пропускной способности памяти, делённой на размер модели. Из этого следует всё остальное: число ядер решает мало, а объём и тип памяти — почти всё. Первая ступень, на которой из нашего каталога поднимается хоть что-то в Q4, — 8 ГБ: 3 модели. ⚠️ Считаем при Q4 — это ходовая разрядность там, где памяти мало.
Сколько у вас памяти — столько и моделей
Своё число памяти вы знаете; таблица переводит его в ответ. Считается при Q4 и контексте 8192 токенов на одного пользователя — то, как модель запускают себе, а не отделу.
| Памяти | Моделей каталога поместится | Самая крупная из них |
|---|---|---|
| 8 ГБ | 3 модели | Qwen3-8B8,2 млрд |
| 16 ГБ | 6 моделей | Mistral Small 3.1 24B Instruct24 млрд |
| 24 ГБ | 8 моделей | Qwen3-32B32,8 млрд |
| 32 ГБ | 8 моделей | Qwen3-32B32,8 млрд |
| 64 ГБ | 9 моделей | Qwen2.5-72B-Instruct72,7 млрд |
| 128 ГБ | 9 моделей | Qwen2.5-72B-Instruct72,7 млрд |
Методология память под модель по снятой архитектуре — как мы считаем. Что исправляли
Потолок скорости на обычной памяти
Считается по одной платформе — Рабочая станция, DDR5-5600, 2 канала, обычный компьютер или младший сервер начального уровня. Полоса выходит 90 ГБ/с, и берём мы 60 % от неё: полной не достаёт ни один движок. Серверные платформы с восемью и двенадцатью каналами — на странице сервера без GPU, там же разобрано, когда видеокарта не нужна вовсе.
| Модель | Веса в Q4 | Потолок | Что это значит |
|---|---|---|---|
| T-lite-it-1.0 7,6 млрд | 3,8 ГБ | 14,1 ток./с | Годится для диалога |
| YandexGPT 5 Lite 8B Pretrain 8 млрд | 4 ГБ | 13,4 ток./с | Годится для диалога |
| Qwen3-8B 8,2 млрд | 4,1 ГБ | 13,1 ток./с | Годится для диалога |
| Vikhr-Nemo-12B-Instruct-R 12,2 млрд | 6,1 ГБ | 8,8 ток./с | Терпимо в фоне |
| GigaChat-20B-A3B-instruct 20,6 млрд | 10,3 ГБ | 5,2 ток./с | Терпимо в фоне |
| Mistral Small 3.1 24B Instruct 24 млрд | 12 ГБ | 4,5 ток./с | Только пакетные задачи |
| T-pro-it-1.0 32,8 млрд | 16,4 ГБ | 3,3 ток./с | Только пакетные задачи |
| Qwen3-32B 32,8 млрд | 16,4 ГБ | 3,3 ток./с | Только пакетные задачи |
| Qwen2.5-72B-Instruct 72,7 млрд | 36,4 ГБ | 1,5 ток./с | Непригодно |
| DeepSeek-V3 684,5 млрд | 342,3 ГБ | 0,2 ток./с | Непригодно |
⚠️ Это потолок, а не обещание: ниже него бывает, выше — нет. Одновременные пользователи делят ту же память между собой, поэтому два потока не удваивают скорость, а делят её: без ускорителя пакетная обработка спасает куда слабее.
Чего мы про это железо не знаем
- Пропускную способность памяти Mac, ноутбуков и телефонов. Мы её не наблюдаем и не переписываем из спецификаций производителя, поэтому скорости для этих машин не считаем вовсе. Ограничение по объёму — считаем: оно от марки не зависит.
- Что дают встроенные ускорители. NPU в телефонах и процессорах, Metal у Apple, движки под одноплатники — всё это меняет картину, и меряем мы этого ничего.
- Скорость на процессоре по замерам. Замеров без видеокарты у нас нет ни одного из 84: чужие публикации, которые мы разбираем, меряют GPU.
- Качество ответов после квантования. Считать в Q4 приходится именно там, где памяти мало, — а чем за это платят, мы не измеряем. Подробнее: GGUF и квантование.