Главная/Аренда/Сервер под ИИ без GPU
СРЕЗ / БЕЗ УСКОРИТЕЛЯ

Сервер под ИИ без GPU: когда видеокарта не нужна

Половина задач корпоративного ИИ живёт без ускорителя вовсе, а вторая половина без него не живёт никак — и граница между ними проходит там, где её обычно не ищут. Разбираем, что упирается в железо на самом деле, и считаем, где именно процессор перестаёт справляться.

Коротко

Генерация текста на процессоре упирается не в вычисления, а в пропускную способность памяти: чтобы выдать один токен, надо прочитать все веса модели. Отсюда потолок — ПСП ÷ размер модели, и он объясняет всё остальное: маленькая модель на процессоре работает, большая не работает нигде, а число ядер решает куда меньше, чем число заполненных каналов памяти. Без GPU уверенно живут векторный поиск, эмбеддинги, классификация и фоновая обработка документов. Нужен ускоритель для диалога с моделью от 30 млрд параметров, для нескольких пользователей сразу, для длинного контекста и для дообучения. Числа в таблице ниже считаются из физики, а не из обещаний. Данные нельзя наружу — закрытый ИИ-контур; нужна карта — аренда GPU.

Правило, из которого следует всё остальное

токенов в секунду ≈ пропускная способность памяти ÷ размер модели

Языковая модель генерирует по одному токену за раз, и для каждого читает свои веса целиком. Значит, скорость ограничена тем, как быстро память отдаёт данные, — а не тем, как быстро процессор считает. Это не эвристика: так устроена авторегрессионная генерация.

Из этого правила сразу следуют три вывода, которые обычно узнают уже после покупки: память важнее ядер; квантование модели ускоряет её ровно во столько же раз, во сколько уменьшает; а сервер с недозаполненными каналами памяти работает кратно медленнее своей спецификации.

Где проходит граница

Скорость генерации в один поток, токенов в секунду. Модели в INT4 — самом выгодном для процессора режиме. Расчёт: пропускная способность × 60% (реально достижимая доля от пиковой) ÷ размер весов. Это оценка порядка величины, а не обещание: конкретный движок, версия и настройка дадут отклонение в обе стороны.

Платформа памяти ПСП 1,5 млрдпараметров8 млрдпараметров32 млрдпараметров70 млрдпараметров
Рабочая станция, DDR5-5600, 2 канала
Обычный компьютер или младший сервер начального уровня.
90 ГБ/с
>60
упрётся в вычисления
13,4
Годится для диалога
3,4
Только пакетные задачи
1,5
Непригодно
Сервер, DDR5-4800, 8 каналов
Односокетная серверная платформа с полностью заполненными каналами.
307 ГБ/с
>60
упрётся в вычисления
46,1
Годится для диалога
11,5
Годится для диалога
5,3
Терпимо в фоне
Сервер, DDR5-4800, 12 каналов
Старшая серверная платформа — предел того, что даёт обычная оперативная память.
461 ГБ/с
>60
упрётся в вычисления
>60
упрётся в вычисления
17,3
Годится для диалога
7,9
Терпимо в фоне

Размер весов в INT4: 1,5 млрд — 0.75 ГБ, 8 млрд — 4 ГБ, 32 млрд — 16 ГБ, 70 млрд — 35 ГБ. У самых маленьких моделей узкое место переезжает с памяти на вычисления, и формула по пропускной способности даёт недостижимое число — такие клетки помечены отдельно. Числа приведены для одного потока генерации. Второй пользователь не получает вторую такую же скорость: память у них общая.

Работает без GPU

Векторный поиск и база знаний

Хранилище эмбеддингов и поиск по нему — чистая работа процессора, памяти и NVMe. Именно этот слой обычно и составляет половину пользы корпоративного ИИ, а видеокарта ему не нужна вовсе.

Построение эмбеддингов

Модели векторизации на два-три порядка меньше языковых, и обрабатывают документы пачками в фоне. Индексация архива на процессоре — вопрос терпения, а не возможности.

Классификация и маршрутизация

Разметка обращений, определение темы и языка, отсев спама, выбор ветки сценария. Модели небольшие, ответ нужен короткий — процессор справляется.

Фоновая обработка документов

Извлечение полей, нормализация, краткие пересказы по расписанию. Никто не ждёт ответа на экране, поэтому две минуты на документ — приемлемо.

Пилот на малой модели

Проверить сценарий и качество ответов на модели до 8 млрд параметров можно и без ускорителя — а уже под доказанную нагрузку считать GPU.

Нужен ускоритель

Диалог с большой моделью

От 30 млрд параметров и выше интерактивная работа на процессоре превращается в ожидание: таблица ниже показывает это без слов.

Несколько пользователей сразу

Память одна на всех, и потоки генерации делят её между собой. На процессоре пакетная обработка помогает куда слабее, чем на GPU, поэтому десять человек — это не «чуть медленнее», а кратно медленнее.

Длинный контекст в RAG

Обработка присланного запроса упирается уже не в память, а в вычисления — и вот здесь процессор отстаёт от ускорителя особенно сильно. Подкладывая в контекст десятки страниц документов, вы платите именно этим.

Обучение и дообучение

Даже экономные методы вроде LoRA на процессоре считаются днями вместо часов. Практического смысла нет.

На что смотреть в конфигурации

ПАМЯТЬ

Сначала объём, потом всё остальное

Модель обязана поместиться в оперативную память целиком, плюс запас на контекст, векторную базу и саму систему. Не поместилась — начинается подкачка с диска, и скорость падает не на проценты, а в разы.

КАНАЛЫ

Заполненные каналы, а не заявленные

Это самая дорогая ошибка в конфигурации. Сервер поддерживает восемь каналов памяти, а поставили в него две планки — и он работает как двухканальный, вчетверо медленнее спецификации. В накладной всё в порядке, на инференсе видно сразу. Спрашивайте не «сколько памяти», а «сколько планок и в скольких каналах».

ЯДРА

Их нужно меньше, чем кажется

За пределами примерно 8–16 потоков память насыщается, и добавленные ядра перестают давать скорость. Процессор с вдвое большим числом ядер при той же памяти почти не ускорит генерацию — деньги уйдут туда, где узкого места нет.

ДИСК

NVMe под индекс и документы

Векторная база и архив документов живут на диске, и от него зависит скорость поиска, а не генерации. Обычный SATA-SSD здесь становится заметен, жёсткий диск — неприемлем.

СТЕК

Без CUDA — другой инструмент

На процессоре работают свои движки инференса, и готовых решений под них меньше, чем под ускорители NVIDIA. Это стоит проверить до аренды: часть корпоративных сборок просто не рассчитана на запуск без видеокарты.

Что дальше

Частые вопросы

Да, и для части задач это разумный выбор. Векторный поиск, построение эмбеддингов, классификация обращений и фоновая обработка документов на процессоре работают нормально. Языковая модель тоже запустится, но скорость упирается в пропускную способность памяти: чтобы выдать один токен, процессор обязан прочитать все веса модели. Отсюда правило — чем меньше модель, тем осмысленнее работа без GPU.